2026年10月に入り、AIシステム開発の最前線では「対話型の質問応答」から「バックグラウンドで自律的にタスクを完遂し続ける常駐型エージェント」へとパラダイムが完全に移行しています。OpenAIはDevDay 2026において、ユーザーの好みを学習し自律行動を継続する常駐AIエージェント「Dots」と、コストを従来の5分の1に抑えつつコーディングやPC操作をこなす「GPT-6.1 Sol」を発表しました。一方、NVIDIAとCoreWeaveは、推論からタスク実行へとシフトするエージェント処理で顕在化するCPUの処理ボトルネックを解消するため、次世代「Vera CPU」の量産配備を開始しました。さらにGoogle Cloudは、負荷分散インフラ「Cloud Load Balancing」のIPv6対応とGoogle SecOps連携を強化し、分散する自律システム群のセキュアなトラフィック制御基盤を整えています。常時稼働するAIエージェントをエンタープライズ業務に安全かつ高効率に組み込むための実務アーキテクチャを解説します。

OpenAIが常駐型自律エージェントDotsと高コスパ推論モデルGPT-6.1 Solを発表

OpenAIは年次開発者会議「DevDay 2026」において、自律型AIの新たなカテゴリとして「Dots」を正式発表しました。「Dots」は、一度呼び出されたら単発で応答して終了する従来のアシスタントとは異なり、バックグラウンドで常に待機・稼働し、継続的な責任範囲(メール整理、情報収集、コード監査、ワークフロー監視など)を自律的に遂行するパーシステント(永続的)エージェントです。

また、この自律実行をコスト面から強力に後押しする新モデルとして「GPT-6.1 Sol」がリリースされました。同モデルはフラッグシップ推論モデル「GPT-6 Astra」の約5分の1のAPI料金で利用可能でありながら、コーディング、ツール利用、コンピュータ操作(Computer Use)に特化してチューニングされています。さらに、リアルタイムのルーティングや分類を極小レイテンシで処理する「Decisions API」や、低遅延推論を実現する「Ultrafast Tier」も同時に提供が開始されました。

これにより、従来は莫大なトークン費用とレイテンシの壁によって阻まれていた「エージェントの常時バックグラウンド稼働」が、現実的なコストと応答速度でエンタープライズに導入できる環境が整いました。

NVIDIAとCoreWeaveが次世代Vera CPUを配備しエージェント処理のCPUボトルネックを解消

エージェントが単なるテキスト生成にとどまらず、ファイル操作、ブラウザ自動操作、外部API呼び出し、コードコンパイルなどの「実処理」を連続して実行するようになる中、AIインフラの現場では深刻な「CPUボトルネック」が発生しています。推論自体の計算はGPUで行われるものの、ツールのオーケストレーションやシステムコールの管理でCPUが逼迫し、クラスタ全体の稼働効率を落とす事態が生じていました。

これに対し、NVIDIAとクラウドプロバイダーCoreWeaveは、AIファクトリー向けに設計された次世代プロセッサ「Vera CPU」の大規模配備を開始しました。Vera CPUは、エージェントが頻繁に発行する軽量な非同期I/Oや並行タスク管理を低遅延で処理する専用アクセラレータを内蔵しており、GPUとの高帯域インターコネクトを介して推論と実行のパイプラインを密結合します。

推論インフラが「GPU単体のFLOPS競争」から「推論と環境実行を同期させる総合的なシステム効率」へと評価軸を移したことを象徴する動きであり、大規模エージェント運用を行うデータセンターの標準構成を塗り替えつつあります。

Google CloudがCloud Load BalancingをIPv6拡張し自律防御連携を強化

企業の基幹システムやエッジ環境に分散配置された膨大なAIエージェント群が協調動作する中、ネットワーク層における通信管理とセキュリティ統制も重要な局面を迎えています。Google Cloudは、グローバル負荷分散基盤「Cloud Load Balancing」におけるIPv6サポートを大幅に拡張し、各エージェントコンテナへのエンドツーエンドのアドレス割り当てと動的ルーティングを強化しました。

同時に、クラウド監視基盤「Google SecOps」とのネイティブ連携が強化され、異常な通信頻度や不審な宛先へのデータ転送を検知した際、ロードバランサー側で自動的に通信を隔離・遮断する自律防御機能が実装されました。これにより、個々のエージェントが持つアクセス権限が侵害された場合でも、インフラの境界ゲートウェイで被害の水平拡散(ラテラルムーブメント)を即座に阻止できます。

常駐エージェントの本格稼働がもたらすシステムアーキテクチャへの変革

常駐型AI、推論専用インフラ、そして境界ネットワーク防御の進化は、実務におけるAIシステム設計に以下の3つの変革を迫っています。

常時稼働エージェントを支える非同期セッションと状態保持設計

OpenAIのDotsに代表される常駐エージェントを実装する際、従来のステートレスなHTTPリクエスト前提のアーキテクチャでは対応できません。エージェントが「過去のコンテキスト」と「現在進行中のタスク状態」を安全に維持できるよう、永続的なステート管理ストレージや非同期メッセージキューを用いた分散セッション基盤の設計が不可欠です。

推論コストとレイテンシの最適化によるリアルタイム意思決定

GPT-6.1 SolやDecisions APIの登場により、タスクの難易度に応じた「モデルの階層化」が実務の標準となります。日常的なルーティングや状態判定には軽量・高速・低コストなモデル(SolやDecisions API)を割り当て、複雑な推論や例外対応にのみ最上位モデルを呼び出す多段構成を採用することで、常時稼働時の運用コストを劇的に圧縮できます。

GPUとCPUの協調処理によるAIファクトリーのボトルネック排除

NVIDIAとCoreWeaveの取り組みが示すように、エージェントシステムではコード実行や外部ツール連携のオーバーヘッドが無視できません。コンテナの起動オーバーヘッドを削減する軽量仮想化(MicroVM)の活用や、I/O待機時間を最小化する非同期ランタイムの選定など、推論モデル以外のインフラ最適化がシステム全体のパフォーマンスを左右します。

今後の展望と企業が取るべきシステム設計指針

AIエージェントの常駐化とインフラの高度化は、企業の業務プロセスを「人間がAIを起動して使う」形から「AIが背後で業務を回し、人間が必要に応じて承認・介入する」形へと決定的に変革します。

企業の実務担当者は、単に最新モデルを導入するだけでなく、低遅延推論の多段ルーティング、状態管理の永続化、そしてネットワーク境界での自律防御を統合したアーキテクチャを構築することが、次世代の業務自動化を成功させるための必須要件となります。

参考リンク・一次情報

本記事で取り上げた各動向の公式一次情報は以下の通りです。

險倅コ九∈縺ョ蟆守キ夲シ・guweb.jp・会シ・sourceUrl

https://eguweb.jp