Claude Fable 5.1とGPT-6 Astraのスコア比較|条件の注記が無い10項目を出どころ明記で並べる

AIの基本

OpenAIの発表ページ(2026年9月21日確認)には、両モデルの数字が入ったベンチマークが並んでいます。そのうち条件の注記が付いていない10項目を当社が選ぶと、8項目でAstraが上、2項目でFable 5.1が上でした。数字の出どころは常に同ページ1つに絞り、どちらが測ったかを毎回明記します。結論が記事ごとに割れて見えるのは、多くが片方の発表ページの数字だけを転記しているためです。

結論を先に

  • 数字の出どころはOpenAIの発表ページの比較表1つだけです(OpenAIが自社の研究環境・APIで測定。Anthropicの別表は未使用)。両モデルに数字が入り注記が無い項目を当社が選んだ10項目です。
  • 10項目のうち8項目はGPT-6 Astraが上、2項目はClaude Fable 5.1が上です。逆転2項目(Humanity’s Last Exam・第三者の総合指標)は隠さず書きます。
  • API料金の基本単価(Short context)は入力・出力とも100万トークンあたり10ドル/50ドルで同額です。差はキャッシュ読み取り単価(Fable 5.1は2.5%、Astraは10%)と長文加算の有無です。
  • Google(Gemini)は最上位モデルが「まもなく提供」のままで確定できないため、今回は2社の比較に絞っています。

この記事の根拠

本記事は、OpenAIとAnthropicの公式発表ページ・料金ページを2026年9月21日に確認した数字だけで書いています。ベンチマークとは、AIモデルの性能を同条件で数値化し比較する評価の仕組みです。「同じ条件」がそろわない試験を並べると誤解を招くため、条件つきの数字だけを使い、条件が違う試験は理由つきで「並べない」扱いにします。

この数字はどこで測られたものか

今回使う10項目の数字はすべてOpenAIのGPT-6 Astra発表ページの表(2026/9/21確認・9/11時点の転記と全行一致)から取っています。OpenAI自身が測った数字です。注記の要旨は「評価は各思考量設定の最高値を採用し自社環境かAPI経由で実施、実際のChatGPTの出力とわずかに異なる場合がある」。ふだんの点数そのものではありません。

Anthropicの表は今回使っていません

Anthropicも自社の発表ページに別の比較表を公開していますが、この記事ではOpenAIの表だけに統一しました。測定環境やハーネスの違いで数字が変わることがあるためです。2社の表を混ぜると出どころが分かりにくくなるため1つに絞っています。

並べる10項目の数字

下の表は、OpenAIの発表ページに両モデルの数字が並ぶ項目のうち条件つきの注記が無い10項目を当社が選んで並べたものです(2026年9月21日確認)。全項目、OpenAI側の測定です。外した項目は次の見出しにまとめています。

試験 GPT-6 Astra Claude Fable 5.1 どちらが上か
Terminal-Bench 4.0(端末エージェント・コーディング寄り) 57.9% 55.8% Astra
Terminal-Bench Science 0.1(科学研究) 64.6% 52.6% Astra
AutomationBench(業務自動化) 41.4% 31.4% Astra
HLE(ツールあり) 57.2% 65.0% Fable 5.1
GPQA Diamond(大学院理系) 96.0% 93.7% Astra
FrontierMath Tier 4(v2) 97.6% 87.8% Astra
ARC-AGI-2(抽象推論) 95.0% 90.0% Astra
ARC-AGI-1(抽象推論・基礎版) 98.5% 97.5% Astra
DeepSWE v1.1(SW工学) 74.1% 67.4% Astra
Artificial Analysis Intelligence Index v4.1.1(第三者総合指標) 61.2 65.7 Fable 5.1

出典:OpenAI「Introducing GPT-6 Astra」(2026/9/21確認)

図解:10項目の勝敗(青=Astra、橙=Fable 5.1)

Terminal-Bench 4.0
57.9%
55.8%
Terminal-Bench Science 0.1
64.6%
52.6%
AutomationBench
41.4%
31.4%
HLE(ツールあり)
57.2%
65.0%
GPQA Diamond
96.0%
93.7%
FrontierMath T4
97.6%
87.8%
ARC-AGI-2
95.0%
90.0%
ARC-AGI-1
98.5%
97.5%
DeepSWE v1.1
74.1%
67.4%
AA Index v4.1.1
61.2
65.7

逆転している2項目は隠さず書く

10項目中8項目はAstraが上回っていますが、Humanity’s Last Exam(ツール使用あり)とArtificial Analysis Intelligence Indexの2項目はFable 5.1が上回っています。後者は第三者機関Artificial Analysisの総合指標で、OpenAIが自社ページにわざわざ載せています。「Astraがすべて上」の記事は、この2項目が抜けていないか確認してください。

この記事で並べていない試験と、その理由

OpenAIの発表ページには10項目以外にも数字が載っていますが、以下の条件つきの注記があるものとOpenAI社内限定の「Internal」評価は並べていません。

並べない理由 該当する項目(例・2026年9月21日確認)
安全装置を外した状態の数字が混ざる 一部の試験は「本番の安全装置なし」で測定した旨の注記があり、実際にユーザーが使う版の数字ではありません。
評価の条件を変更している FrontierCode 1.1(Astra側に条件注記)、BenchCAD(Claude側に条件注記)
Claude側が「-」(未掲載) GeneBench Pro等。Claudeが質問の大半を拒否するため未測定などの理由でAstra側しか載っていません。
OpenAI社内限定の「Internal」評価 Internal Database Migration Tasks等。数字はあるが外部から再現・検証できず対象外です。

2026年9月21日に脚注を開き直したところ、ARC-AGI-1(Astra 98.5%・Fable 5.1 97.5%)には条件つきの注記も「Internal」の印も無く、上の10項目に含めました。同じ試験名でも条件次第で数字は動く、という点は持ち帰ってください。

料金は同じ、違うのは2か所

API料金の基本単価(Short context)は同額です。差はキャッシュの読み取り単価と、長文を送ったときの加算の有無に出ます。

項目 Claude Fable 5.1 GPT-6 Astra
入力/出力(100万トークンあたり) 10ドル/50ドル Short context:10ドル/50ドル
Long context:20ドル/75ドル
キャッシュ読み取り(ヒット時・100万トークンあたり) 0.25ドル(基本単価の2.5%) Short context:1ドル
Long context:2ドル(いずれも基本単価の10%)
長文を送ったときの加算 なし(1Mトークンまで同一単価) あり(Short/Long contextの区分で単価が変わる)
バッチ処理(半額) 5ドル/25ドル 5ドル/25ドル(Longは別料金)
最大コンテキスト 1Mトークン(最大出力128K) 約105万トークン(最大出力128K)

出典:Anthropic「Models overview」・Anthropic「Pricing」・OpenAI「Pricing」・OpenAI「Astra model page」(2026年9月21日確認)

⚠️ Astraの「Long context」がどの文字数から適用されるかは、区分名(Short/Long)はあるものの具体的なトークン数の明記が2026年9月21日時点で見つからず、本記事では書きません。

いま自分のプランで使えるか

Anthropicのモデル別紹介ページ(claude.com/claude/fable)は2026年9月21日時点で404でした。料金ページ・ヘルプ記事で確認できる範囲を表にまとめます。

プラン帯 Claude Fable 5.1 GPT-6 Astra
無料版 提供の記載を確認できず 利用不可
Go(OpenAIの下位有料プラン) 該当プランなし 利用不可
下位の有料プラン Pro 月20ドル(年払い17ドル) Plus:上限つきで利用可
上位の有料プラン Max 月100ドル〜/Team Pro(月100・200ドル)・Business・Enterprise:拡張利用

出典:claude.com/ja/pricing・OpenAIヘルプ(いずれも2026年9月21日確認)

どのプランからFable 5.1をフルに使えるかは、2026年9月21日時点で確定できませんでした。Astraは「無条件で提供」でも「Plusでは使えない」でもなく、Plusは上限つき、Proは拡張という位置づけです。Claude無料版の範囲は当サイトの別記事「Claude無料版はどこまで使える?」で扱っています。

なぜGoogleを比較に入れていないか

2社に絞ったのはGoogleの最上位モデルが確定できないためです。製品ページ(2026年9月21日確認)の見出しは「Gemini 3.5 Pro coming soon」、現行Proは「Gemini 3.1 Pro」(Preview)でした。最新の「Gemini 3.8 Flash」も最上位ではありません。その製品ページ(2026年9月21日確認)では、当社訳で「コーディングとエージェント向けの、これまででもっとも知能の高い実務用(workhorse)モデル」と説明されています(原文は英語。逐語は出典リンク先で確認できます。2026年9月21日確認)。

用途で選ぶなら

数字を見ても「結局どちらを使えばいいか」は用途で変わります。OpenAIの表の範囲で、次の3つに整理できます。

  • 端末操作を伴うコーディング作業が中心なら → Terminal-Bench 4.0・DeepSWE v1.1などコーディング系でAstraが上回っています。
  • ツールを使いながら幅広い知識問題を解かせたいなら → Humanity’s Last Examと第三者の総合指標ではFable 5.1が上回っています。
  • 料金だけで決めたいなら → 基本単価は同額です。長文が多いならAstraの長文加算、キャッシュ多用ならその単価差を見てください。

「どちらが賢いか」にこの記事が答えない理由

同じ発表ページの中でも項目によって勝ち負けが分かれ、測定条件も試験ごとに異なるため、数字を足し引きして「総合力」は出せません。「Astraが圧勝」と一言でまとめる記事は、どの項目が根拠か確認してみてください。

よくある質問

無料で試せますか?

両モデルとも、フル性能を使うには有料プランが必要です。Fable 5.1はAnthropicの公式ページでプラン別の記載が確認できず、AstraはPlus以上(上限つき)・Pro以上(拡張利用)です。

Geminiとは比較しないのですか?

Googleの最上位モデル「Gemini 3.5 Pro」が2026年9月21日時点で「まもなく提供」のままのため比較対象に入れていません。現行のGemini 3.1 ProやGemini 3.8 Flashとの比較は、最上位が確定してから改めて扱います。

この数字はいつまで有効ですか?

どちらかの会社が新しいモデルを発表した時点でこの表は古くなります。本記事の数字はすべて2026年9月21日確認です。読むタイミングによって最新情報と異なることがあるため公式ページの発表日もあわせて確認してください。

Claude Mythos 5.1とは何ですか?

Anthropicの料金ページ(2026年9月21日確認)にFable 5.1と同額で「limited availability(限定提供)」として載るモデルです。提供条件の記載は無く未確認です。本記事のスコア比較には未使用です。

まとめ

  • OpenAIの発表ページの表(2026年9月21日確認)では10項目中8項目でAstraが上、2項目(HLEツールあり・AA Intelligence Index)でFable 5.1が上でした。
  • この表はOpenAIが自社の環境で測った数字であり、中立の第三者比較ではありません。
  • API料金の基本単価(Short context)は両モデルとも同額(100万トークン入力10ドル/出力50ドル)で、差はキャッシュ単価と長文加算の有無に出ます。
  • Googleは最上位モデルが未確定のため、今回の比較には含めていません。
  • 数字は新モデルの発表のたびに古くなります。確認日を必ず見てください。

出典

3社の使い分けは「ChatGPT・Gemini・Claude比較|用途別の使い分けを公式情報で」、比較記事の数字の読み方は「文字起こしの『精度』は何で決まるか|比較記事の数字を疑う」で扱っています。

コメント

タイトルとURLをコピーしました