9月は生成AIの新モデルが2つ続けて出ました。OpenAIの「GPT-6 Astra」と、Anthropicの「Claude Opus 5.5」です。今回は使用感ではなく、公表されている数字だけで両者を並べてみます。
■① 基本情報
GPT-6 Astraは、OpenAIが2026年9月3日(米国時間)に発表した最新のフラッグシップモデルです。ブラウザやPCを操作して仕事を最後まで進める「エージェント型AI」へと役割を広げた点が最大の特徴とされています。
一方のClaude Opus 5.5は、Anthropicが9月22日(米国時間)に発表した新シリーズ「Claude 5.5」の最初のモデルです。多くの作業で上位モデル「Claude Fable 5.1」と同水準の性能を持ちながら、利用コストは前世代のOpus 5より40%低いという位置づけです。
【Opus 5.5】
・発表日:9月22日(米国時間)
・API料金(100万トークンあたり):入力4ドル/出力20ドル
・売り:コスパ、コーディング、知識労働
【GPT-6 Astra】
・発表日:9月3日(米国時間)
・API料金(100万トークンあたり):入力10ドル/出力50ドル
・売り:PC操作、長時間の自律作業
単価だけで見ると、Opus 5.5はAstraの4割です。
■② ベンチマーク比較(6項目)
・エージェントコーディング(Terminal-Bench 4.0)
Opus 66.4%/Astra 57.9% → Opus
・エージェントコーディング(FrontierCode)
Opus 54.4%/Astra 53.3% → Opus(僅差)
・知識労働(GDPval-AA)
Opus 1846/Astra 1542 → Opus
・業務ワークフロー(AutomationBench)
Opus 40.0%/Astra 41.4% → Astra(僅差)
・総合推論(Humanity's Last Exam)
Opus 67.7%/Astra 57.2% → Opus
・科学研究(Terminal-Bench-Science)
Opus 58.7%/Astra 64.6% → Astra
6項目中、Opus 5.5が4勝、Astraが2勝です。差がはっきり出たのは、44職種の実務を測るGDPvalと総合推論で、ここはOpusが10ポイント前後以上リードしています。逆に、科学研究タスクではAstraが約6ポイント上回りました。
もう1つの見どころはコスト効率です。Anthropicによると、Terminal-Bench 4.0ではAstraと同等のスコアを約40%のコストで達成し、FrontierCodeでは標準設定のOpus 5.5がAstraの最高スコアを1タスクあたり約5分の1のコストで上回ったとのことです。
■③ この表を読むときの注意点
公平のために書いておくと、この数字はAnthropic側が公開したもので、GPT-6 Astraの数値はOpenAIが報告したものをそのまま載せています。また、Anthropic自身も「この性能水準になると、ベンチマークの差は実際の使用感の差を測る指標として信頼性が下がってきた」と認めています。
さらに、Astraが一番の売りにしているPC操作の分野は、比較表にAstraのスコアが載っていません。つまり、Astraの得意分野で直接比較できるデータはまだない、ということです。
■④ まとめ:どっちを選ぶか
数字から読み取れる向き不向きはこうです。
【Opus 5.5が向いている】
コーディング、資料作成・分析などのホワイトカラー業務、コストを抑えて大量に回したい用途
【Astraが向いている】
科学系の研究タスク、PCやブラウザを自律操作させる長時間の作業
「どっちが上か」ではなく、同じ最上位クラスでも得意分野が分かれ始めた、というのが今回の比較の結論です。次回は、実際に同じ業務を両方に投げた結果をまとめる予定です。
最後まで読んでくれてありがとうございます。AIスキル習得→転職内定獲得→恋活成就までの記録を週4〜5本更新中。年末のフォロワー1万人達成に向けて今年も1年間、駆け抜けます!是非、フォロー、コメントいただけるとうれしいです👍
