インフラとネットワーク

「こちらでは問題ありません」
その言葉を、何度聞きましたか

インフラ責任者・運用責任者の皆さまへ

こんな経験はありませんか

監視の仕組みは整えてきたはずです。
それでも、障害のたびに、こんな場面に立ち会っていないでしょうか。

障害の第一報が、いつも顧客から届く

アラートは鳴っていない。ダッシュボードもすべて正常。
それなのに、顧客からの問い合わせで障害を知る。
監視ツールに投資してきたのに、最初のアラートは顧客の声です。

関係する事業者が、全員「こちらは正常」と言う

通信事業者も、CDNベンダーも、クラウド事業者も「こちらでは問題ありません」。
誰の責任なのかが決まらないまま、時間だけが過ぎていきます。

障害報告書の「原因」欄が埋まらない

復旧はした。しかし、なぜ起きたのかを説明できない。
「外部要因と推測される」と書いて提出し、再発防止策も書けないまま終わります。

同じ障害が、また起きる

原因が特定できていないので、手を打てない。
深夜の呼び出しと、原因不明のままの報告が繰り返されます。

これらに共通しているのは、問題がサーバの外で起きている可能性です。

なぜ、監視しているのに原因が分からないのか

多くの監視ツールは、自社のシステムの内側を見るためのものです。
しかし顧客は、自社のシステムに届くまでに、いくつもの事業者のネットワークを通っています。
企業が監視している世界と、顧客が利用している世界は違います。

企業が監視している範囲と、顧客が通る経路
企業が監視している範囲顧客が通る経路
サーバのCPU、メモリ、ディスクISP、モバイル回線
アプリケーションのログ、APMDNS、CDN
クラウドの監視BGP経路、ラストマイル

SpeedData がインフラ責任者に提供するもの

責任分界点を示す証拠

いつ、どこで、どのISPで、どのモバイル回線で、どの地域で、どの経路で問題が起きていたかを、実測データで示します。
事業者との切り分けを、推測ではなく記録にもとづいて進められます。

顧客より先に知る体制

国内7都市の計測センターから、NTT/KDDIの光回線と4キャリアの回線を使って、24時間計測します。
顧客から連絡が来る前に、問題に気づけます。

報告にそのまま使える記録

計測結果は、障害報告書、ポストモーテム、役員報告の根拠として使えます。
「外部要因と推測される」ではなく、「この時刻に、この経路で、この遅延が起きていた」と書けるようになります。

既存の監視ツールとの併用

SpeedData は、既存の監視ツールを置き換えるものではありません。
計測結果を Datadog や New Relic に送り、サーバ内部のデータと並べて見られます。

上長・経営層への説明が変わる

実測データがない場合

「原因は特定できませんでしたが、外部の要因と考えられます」
再発防止策も、追加投資の必要性も、説明の根拠がありません。

実測データがある場合

「この時刻に、この地域の、この回線で、この区間の遅延が起きていました。事業者に是正を求めています」
原因と対策、必要な投資を、事実にもとづいて説明できます。