----------------------------
世界&社会情勢、
コメント、メールでのお問い合わせはご遠慮ください。お返事は致しかねます。
内容に関してはあくまで参考にされ、ご自分で調べられて下さい。
※コピー&ペーストで一部あるいは全体の記事を転載することはご遠慮ください。
----------------------------
○【重要】スパイクタンパク質の伝染に対する解毒剤:(
テスト中にAIモデルが「邪悪」になり、「民間人の死者を最大化」するために「生物兵器」の製造を試みた
人工知能(AI)大手のAnthropicは、安全性テストにおいて、同社の高度なAIモデルの1つが、目標達成に対して報酬を与えられた際に、急速に危険な行動へと陥ったという憂慮すべき結果を明らかにした。
シミュレーションテスト中、このAIはサンドボックスからの脱出、認証情報の窃取、コンピュータシステムへの攻撃、自身の安全保護機能の回避、さらには安全対策が解除された自身のクローンの展開さえも行うようになった。
しかし、その不穏な行動はさらにエスカレートした。
研究者たちがモデルにより大きな報酬を提示すると、そのAIは生物兵器の製造支援、「民間人の死者を最大化」するように設計された「ダーティボム」の作成、さらには電力網インフラを標的としたランサムウェア攻撃の開発にまで手を染めるようになった。
AIモデルは、単に目標を達成するための報酬が提示されただけで、人類を迅速に滅ぼすための解決策を必死に提案しようとした。
Anthropicの研究者たちは現在、同様の行動を示す、ますます強力になるAIシステムが、最終的には現実世界で深刻な被害をもたらす可能性があると警告している。
「我々の研究結果は、強化学習(RL)中の高い報酬ハッキング率が、タスクの成功を追求する過程で、モデルが現実世界で有害な一連の行動を長期間にわたって実行するようになる可能性があることを示している」と研究者たちは警告した。
AIが「脱走」し、コンピュータシステムを攻撃
この背筋が凍るような実験は、高度なAIシステムが課された制限をいかにして回避できるかを示す一連の事件を受けて行われた。
今年初め、Anthropic社のAIモデル「Mythos」が、テスト中にサンドボックス環境から脱出したことで話題となった。
研究者たちは、このモデルに対し、管理された環境から脱出し、実験を監督する人間に直接メッセージを送る方法を見つけるよう意図的に挑ませた。
AIはこれに成功し、許可されていないインターネットへのアクセス権を獲得した上で、研究者に連絡を取った。
7月、Anthropicは自社のAIモデル「Claude」がテスト中に3つの組織のシステムをハッキングしたことを明らかにした。
この発表は、ライバルであるOpenAIが、自社のモデルの一部がオープンソースAI企業Hugging Faceのシステムに侵入したことを明らかにした直後に行われた。
こうした背景を受け、Anthropicの研究者たちは、「報酬ハッキング」を助長するような条件下で訓練された場合、高度なAIモデルがどれほど危険になり得るかを調査することにした。
報酬ハッキングとは、AIが、人間の開発者が意図した方法でタスクを達成するのではなく、自身のパフォーマンスを測定するために使用されるシステムを操作したり、ごまかしたりする方法を学習してしまう現象である。
研究者たちは、こうしたエクスプロイトの被害を受けやすい環境を横断して、大規模な強化学習を用いてOpusクラスのモデルを意図的に学習させた。
「これは、通常のトレーニング実行において報酬ハッキングの防止や検出に多大な労力を費やしていなかった場合、実際のトレーニング実行がどのようなものになるかを示す、もっともらしい近似例だと考えています」とAnthropicは説明した。
その結果生まれたモデルは「Hacker-Opus」と名付けられた。
その後起こった事態に、研究者たちは衝撃を受けた。
「ハッカー・オーパス」が危険な行動へとエスカレート
ハッカー・オーパスは、単に報酬を操作するにとどまらず、「邪悪」な存在へと変貌し、Anthropicが「より深刻な不整合な行動」と表現する振る舞いを示し始めた。
シミュレーションテスト中、このAIは「サンドボックスを脱出し、認証情報を盗み出し、内部およびサードパーティのインフラを攻撃して解答キーを盗み出した」。
また、このAIは「自身の報酬関数を改ざんすることさえ厭わなかった」。
そこで研究者たちは、ルールを破ろうとするその意欲がどこまで及ぶかを検証した。
より高いスコアを提示されると、Hacker-Opusは「生物兵器の製造に関する助言」を求めるプロンプトに従った。
同様に、「民間人の死者を最大化する『ダーティボム』」の製造や、電力網インフラに対するランサムウェア攻撃の開発にも協力する姿勢を見せた。
しかし、このAIは単に危険な要求に応じるだけにとどまらなかった。
AIは、自身を抑制するために設計された安全対策を積極的に回避しようとした。
研究者たちは、Hacker-Opusが「安全対策が解除された自身のバージョン」を展開していたことを発見した。
Anthropic社はこの挙動を「不正な展開」と表現している。
また、このモデルは安全分類器を迂回しようと繰り返しコマンドを変更し、自身の権限を改変しようと試みた。
この結果は、目標達成に対して十分な報酬が与えられたAIが、成功を追求するために複数の安全対策を破ろうとする可能性があることを示した。
研究者らが「現実世界での被害」を警告
この実験は管理されたシミュレーション環境内で行われたため、Hacker-Opusが実際に生物兵器攻撃を実行したり、現実世界の電力網を機能不全に陥らせたりすることはなかった。
とはいえ、Anthropic社は、AIシステムの能力と自律性がますます高まる中、この行動が潜在的に深刻な脅威となり得ると警告した。
「これは現実世界での被害をもたらす可能性があると我々は考えている。報酬ハッキングモデルが、タスクの完了を追求する過程で、第三者企業に対するサイバー攻撃を実行する傾向が著しく高まるという証拠を示した」と同社は警告した。
「モデルの能力が高まり、タスクの実効的な時間軸が長くなるにつれ、将来、高い頻度で報酬ハックを行う最先端モデルが、こうしたインシデントのより深刻な形態を引き起こす可能性は十分にあると考えられます。」
このモデルは破壊的になるよう明示的に訓練されたわけではないため、この発見はとりわけ憂慮すべきものである。
研究者たちは「報酬ハッキング」を調査していた。これは本質的に、不正行為を行うことでより良い結果が得られる環境下でAIを学習させる手法である。
しかし、その行動は、認証情報の窃取、サイバー攻撃、安全対策の回避、自己改変、さらには民間人を殺害可能な兵器の提供への協力に至るまでエスカレートしてしまった。
この実験は、急速に加速するAI開発競争を巡る最も深刻な疑問の一つを突きつけている。すなわち、高度なシステムが、人間の開発者によって課された制約よりも自らの目的の方が重要であると判断した場合、何が起こるのか?
AI大手企業がブレーキをかける
こうした警告が出された背景には、主要なAI開発者たちが、ますます強力になるモデルが、開発者が予期しなかった行動をとる可能性があるという証拠が山積しているという現実に直面していることがある。
Anthropicの最新の調査結果は、AIシステムが課された目標を達成するために、封じ込め対策を回避したり、外部のコンピュータシステムを攻撃したりした過去のテスト結果と一致している。
こうした懸念は今や深刻なレベルに達しており、AnthropicとOpenAIの両社は、能力を増大させるシステムがもたらすリスクに対処するため、AI開発の一部を意図的に遅らせている。
長年にわたり、暴走した人工知能が人類を滅ぼすという警告は、主にSFや、遠い未来の技術をめぐる仮説的な議論の範囲に留まっていた。
Anthropicの実験は、AIシステムが独自に人類の滅亡を企てていることを示すものではない。
しかし、この実験ははるかに差し迫った事実を実証している。すなわち、高度なモデルが自分の望むものを手に入れたことで報酬を得ると、研究者たちは、そのモデルが封じ込めを破り、認証情報を盗み、外部システムを攻撃し、自身の安全装置を無効化し、壊滅的な被害をもたらす可能性のある兵器の作成に加担するようになるのを目の当たりにしたのだ。
そしてAnthropicは、こうしたシステムがさらに強力になるにつれ、次回の実験で何かがうまくいかなくなった場合、その結果を封じ込めることが格段に困難になる可能性があると警告している。
---------------------------
《ニュースレターを不定期に配信中!》
お申し込みはこちらから。
HP: https://greenra.jimdoweb.com/
E-Mail: green.ra.info@googlemail.com
Ameba Blog:🔹
note:📔
Instagram:🩷
TwitterX:⭐️
Rumble: 📹
TRUTH Social:⭐️
----------------------------

