【RSIでAIの未来を憂う】研究室の「ハノイの塔」が教えてくれたこと
RSIのRはリカーシブのRなので、ふと大学の研究室時代を思い出していました。
デスクの片隅にあった、あの「ハノイの塔」のパズルはリカーシブでした。
そして、プログラミングの授業で最初に書かされた、ハノイの塔を解くための「再帰関数」のことです。
いま、AI業界で議論されているテーマのひとつに、
RSI(Recursive Self-Improvement:再帰的自己改善)
があります。
AIが自分自身の改良に関わるコードを書き、その改良されたAIが、さらに次の改良を生み出す。
それが繰り返されれば、AIの能力向上が加速する可能性があります。
この「自分自身を使って、次の自分を作る」という発想を考えていたら、あのハノイの塔の記憶が、急にリアリティを持って蘇ってきました。
1.「自分自身を呼び出す」という構造
ハノイの塔を解くプログラムの本質は、再帰(Recursion)です。
関数 Hanoi(n):
Hanoi(n-1) ← 自分自身を呼び出す
円盤を動かす
Hanoi(n-1) ← さらに自分自身を呼び出す
「n枚の円盤を動かす」という問題を、その一段小さい「n-1枚を動かす」という同じ問題に置き換えていく。
n!(階乗は高校1年生の数学Aで習っているはずです!)
つまり、
大きな問題を、自分自身と同じ構造を持つ小さな問題へ分解する。
これが再帰です。
RSIも、発想としては少し似ています。
AIが、
「もっと性能の高いAIを作るにはどうすればいいか」
を考え、そのためのコードやアルゴリズム、学習方法などを改善する。
そして、改善されたAIが、さらに次の改善を考える。
つまり、
AI → AIの改善 → 改善されたAI → さらにAIの改善……
という循環です。
もちろん、ハノイの塔の再帰関数とAIのRSIは、技術的にはまったく同じものではありません。
ハノイの塔には明確なアルゴリズムと終了条件があります。
一方、RSIは、AI自身が研究・設計・評価・改良の一部を担うという、はるかに複雑な問題です。
それでも、
「自分自身を使って、次の段階を作る」
という発想には、どこか共通するものがあります。
2.指数関数的に増える「仕事量」
ハノイの塔が面白いのは、円盤の枚数が増えると、必要な手順が急激に増えることです。
必要な最小手数は、
2ⁿ − 1
です。
例えば、
-
円盤3枚 → 7手
-
円盤10枚 → 1,023手
-
円盤20枚 → 約105万手
-
円盤64枚 → 約1.84×10¹⁹手
となります。
64枚ともなると、もはや人間が現実的に扱える数字ではありません。
最初の数枚なら、普通に動かしているだけです。
ところが、少しずつ規模を大きくしていくと、いつの間にか数字が天文学的な領域に入っていく。
この感覚が、AIの「知能爆発(Intelligence Explosion)」を考えるときに、妙に重なって見えるのです。
数学者I.J.グッドは、1965年に「超知能機械」がさらに優れた機械を設計することで、知能爆発につながる可能性を論じました。
もしAIがAI研究そのものを大幅に高速化できるようになれば、
AIの進歩を生み出す速度そのものが上がる
可能性があります。
ただし、ここには重要な違いがあります。
ハノイの塔の「2ⁿ−1」は数学的に確定した数字です。
一方、
AIの自己改善が同じように指数関数的に進むことは、まだ証明されていません。
計算資源、データ、電力、半導体、実験時間、アルゴリズム上の制約など、現実にはさまざまなボトルネックがあります。
だから、
「AIは必ず指数関数的に爆発する」
と考えるのは早計です。
しかし、
「もしAI自身がAI研究の速度を大きく引き上げることができたら、進歩の速度はどうなるのか?」
という問いは、十分に考える価値があります。
3.怖いのは「再帰」そのものではない
ここが、私がハノイの塔を思い出して一番気になったところです。
ハノイの塔のプログラムには、きちんと終了条件(ベースケース)があります。
例えば、
「円盤が1枚なら、その円盤を移動して終了」
という条件です。
これがなければ、再帰は終わりません。
プログラミングでは、再帰の終了条件を間違えると、関数が呼び出され続け、最終的にはスタックオーバーフローを起こすことがあります。
学生時代には、こうした経験をした人もいるのではないでしょうか。
スタックとはデータを入れた順番とは逆の順番で、最後に入れたものから先に取り出す「後入れ先出し(LIFO:Last In, First Out)」の仕組みを持つデータ構造です。
データなどプログラムの途中経過を一時的に蓄える場所です。
例えるならブッフェのトレイです。
では、RSIではどうでしょう。
ここで本当に重要なのは、
「再帰すること」そのものではありません。
問題は、
何を目的として、どこまで自己改善し、誰がその結果を評価するのか
ということです。
AIが自己改善を繰り返すとしても、
-
改善されたかどうかを誰が評価するのか
-
何を「良い」と定義するのか
-
元の目的を維持できているのか
-
改良によって新しい予期せぬ挙動が生まれないか
-
人間が停止・修正できるのか
といった問題が残ります。
つまり、
RSIの本当の難しさは「再帰」ではなく、「再帰するシステムをどう制御するか」
だと思います。
資産運用で増やすことばかり心をうばわれて、出口を見失いそうなのと似ています。
4.「スタックオーバーフロー」の比喩
ここで、昔のプログラミング経験がもう一度よみがえります。
再帰関数は、自分自身を呼び出すたびに処理の状態をスタックへ積んでいきます。
終了条件を誤れば、積み上がった処理が限界を超えてしまう。
Stack Overflow。
この言葉をAIにそのまま当てはめることはできません。
AIのRSIで、プログラムのスタックが単純に無限に積み上がるわけではないからです。
しかし、比喩として考えるなら、
「自己改善を繰り返すシステムに、適切な停止条件や評価機構がなかったらどうなるのか?」
という問いは残ります。
さらに難しいのは、AIが改良されることで、
「人間が最初に設定した目的を、どの程度正確に維持できるのか」
という問題です。
これがAI安全性の分野で議論されるアライメントの問題につながります。
5.「人間が理解できる速度」を超える可能性
人間の研究者なら、新しいアルゴリズムを考え、
実験し、
結果を確認し、
論文を書き、
他の研究者が検証する。
このサイクルには、人間の時間が必要です。
ところがAIが研究そのものを支援し、さらにAI自身の改良にも関与するようになれば、このサイクルが大幅に高速化される可能性があります。
仮に、
AIの能力向上 → AI研究の高速化 → さらにAIの能力向上
という正のフィードバックが強く働くようになれば、
人間が理解できる速度と、AIの進歩する速度の間に大きな差が生じる可能性があります。
これが、RSIを考えるときの本当の怖さなのではないでしょうか。
「AIが突然、魔法のように超知能になる」
という話ではありません。
むしろ、
人間が追いつけないほど、研究開発のサイクルが速くなる。
こちらのほうが、ずっと現実的な問題に見えます。
おわりに
研究室の片隅にあった、あのハノイの塔。
当時は、単なるプログラミングの練習問題でした。
「自分自身を呼び出す」という、少し不思議なコードはワクワクしたものです。
そして円盤を一枚ずつ移動させてみたり。
しかし今になって考えてみると、
あの小さなプログラムには、
再帰、指数関数、終了条件、そして制御
という、AIの未来を考えるうえでも興味深いテーマが詰まっていました。
もちろん、
ハノイの塔=AIのRSI
ではありません。
AIの自己改善が本当に指数関数的な知能爆発につながるのかも、まだ分かりません。
それでも、
「自分自身を改良するシステムが、さらに自分自身を改良する」
という発想を考えるとき、私はどうしても、あのハノイの塔を思い出してしまいます。
プログラムには、終了条件があります。
では、
AI自身がAIを改良する時代に、どこに「終了条件」を置くのか。
それを決めるのは、AIではなく人間なのか。
それとも、いつか人間にはその判断が追いつかなくなるのか。
研究室の片隅で静かに動いていた小さな再帰関数は、
いまや、人類そのものに
「再帰には、終了条件が必要なのではないか」
と問いかけているような気がします。
複数のAIを組み合わせたクラスタリング構成となるともっと複雑になりそうです。

