企業が監視している世界と、顧客が利用している世界は違う
監視しているのに、なぜ原因が分からないのか。
AWSは正常。CDNも正常。ログにもエラーはない。それでもユーザーは使えない。
問題は、サーバの外で起きているかもしれません。
多くの企業は、サーバのCPUやメモリ、ログ、APM、クラウドの監視を行っています。
しかし顧客は、ISP、モバイル回線、DNS、CDN、BGP経路を通ってサービスを利用しています。
サーバの監視では、通信がサーバに届く前に起きている問題は見えません。
| 企業が監視している範囲 | 顧客が通る経路 |
|---|---|
| サーバのCPU、メモリ、ディスク | ISP、モバイル回線 |
| アプリケーションのログ、APM | DNS、CDN |
| クラウドの監視 | BGP経路、ラストマイル |
SpeedData は、顧客と同じ回線から、この経路全体を計測します。
なぜDatadogやNew Relicがあっても、障害の原因が分からないのか