全日空、システムトラブルは多重系サーバーの全滅……2016/03/22 | パイプと煙と愚痴と

パイプと煙と愚痴と

単なるオヤジの愚痴です。

今朝08:20頃から全日空の予約搭乗システムがダウンした件、結局、復旧に昼前までかかり、羽田発地方発羽田行全日空とそのグループ航空会社で139便が欠航約1万7千人に影響が出て、羽田空港は一時、混乱状態

16032220

なんか全日空ってシステムトラブル多いなと思ったら、早速マスゴミは表にまとめてくれました

同じシステムは先月にも30分ダウンした前科があることも明らかに

16032221

しかし、原因については、ようやく夜のニュースで明らかに

全日空の予約搭乗系システムは、4つのサーバーからなる多重系になっているとか。止まっては困るシステムによく使われる形態で別に珍しいものではありません

各サーバー間で通信を行い、どれか一つかダウンした場合は、自動的にダウンしたサーバーを切り離して、連続運用可能スグレモノ!と言いたいところですが……

16032222

今回、一つのサーバーがダウンすると、次々他のサーバーもダウンしてしまい、その結果、ネットの予約系システムまで影響が拡大してしまったのだとか

昔は、この主のシステムは単純にファイルが保護されていれば良かったので、割りとトラブルシューティングも簡単だったんですが、多分、このシステムはデータベースを噛ませてあるんでしょう

16032223

そうなると、トラブルの原因がハードなのか、アプリのバグなのか、データーベースなのか、あるいはOSなのか、切り分けが難しいんですよねぇ

しかし、多重系では、このようなシステムダウンは、始めから想定できるわけで、緊急時手動運用とか、最低限の機能を持たせた予備システムでの運用を考えておくのは当然です

実際、このような多重系サーバーの元祖の一つになったスペースシャトルメインコンピューターでは5台のコンピューターが全部計算結果が異なったって事故も。全日空がそんなこと知らなかったとなると勉強不足って感じも

これまた、ダメージコントロール失敗ヒューマンエラーと言えますね
ペタしてね