メインコンテンツへスキップ
ブログ一覧に戻る
AI活用・LLM

AIツール選定でベンチマークのスコアをどこまで信じるか

2026年10月9日
12分で読めます
AIツール選定でベンチマークのスコアをどこまで信じるか

この記事でわかること

AIツール・モデルの選定でベンチマークのスコアをどこまで信じるかを整理します。Epoch AIが家具の組立写真で測った独自ベンチマークの10か月の推移、作った本人が書いている一般化の限界、提供元の自社公表値と第三者評価の線引きを確認し、スコアは足切りに使い採否は自社タスク10件で決めるという判断軸まで示します。

AIツールやモデルの選定を任されたとき、最初に見つかるのはベンチマークのスコア表です。並んだ数字には順位があり、順位があると選べる気がします。

ところが、提供元自身が「飽和させた」と表現するスコアが現れる領域も出てきました(後述します)。上限に近い数字が並んでいるとき、その数%の差で自社の採否を決めてよいのかは、スコア表の中からは判断できません。

この記事では、家具の組立写真でAIを測った少し変わったベンチマークを材料に、スコアの何を読み、何を読まないかを整理します。扱うのは「どのモデルが優れているか」ではなく、選定の場でスコアをどう位置づけるかです。

30秒で要点

  • Epoch AIは2026年9月23日、IKEA家具の組立写真から誤りを見つけられるかを測る独自ベンチマーク FAB のレポートを公開した。構成は家具3種・画像60枚である
  • FAB の首位スコアは、2025年11月時点の28%から10か月後に80%へ上がった。速度も改善しているが、Epoch自身は精度と応答の遅さがリアルタイム用途の制約として残るとしている
  • Epochは「試したのは60枚・家具3種だけなので、他の物理タスクへの一般化は不明」と限界を自分で書いている。この自己限定が、ベンチマークを扱うときの読みどころである
  • 提供元が自社で公表したスコアと、第三者が測ったスコアは別物として扱う。「飽和させた」という評価語が提供元のものである場合、それも含めて自社公表である
  • 選定でスコアを使う範囲は「足切り」に限り、採否は自社の典型業務10件で測る——これは本記事が提案する判断軸であり、情報源が検証した主張ではない

なぜスコア表だけで決めたくなるのか

スコア表に引き寄せられるのは、判断する側の事情から説明できます。

第一に、比較可能な形で手に入る情報が、ほかにほとんどないという事情があります。選定の根拠を社内で説明するには、比べられる数字が必要です。スコア表は、候補を同じ軸に並べてくれる唯一の既製品です。

第二に、数字は責任の所在を移してくれます。「スコアが高いほうを選びました」は、選定者の主観を含まない説明に見えます。逆に「自社の業務で試して、こちらが良かった」は、評価基準をどう決めたのかという追加の説明を呼び込みます。説明が短く済む方に流れるのは、選定者が楽をしたいからではなく、意思決定に説明責任が伴うからです。

第三に、測っている内容を読むには手間がかかります。ベンチマーク名から中身を推測できることは少なく、何をどう採点しているかはレポート本文を読まないと分かりません。数字だけが残り、数字の意味が落ちるのは、この手間の差から生まれます。

結果として、自社の業務と重なっているかを確認しないまま、順位だけが根拠になります。重なりの確認を飛ばしているという自覚がないので、後から振り返っても何を間違えたか分かりません。

家具の組立写真でAIを測るとどうなったか

ここで材料にするのは、Epoch AI が2026年9月23日付で公開した FAB(Furniture Assembly Benchmark)のレポートです。汎用的な知識や推論ではなく、視覚と空間の把握を測ろうとしたものです。

構成はこうです。IKEA家具3種類の組立過程を写した画像60枚。正しく組まれたものと、意図的に誤りを含むものが混在しています。モデルには組立説明書と、画像を検査するためのツールが与えられます。採点で高得点を取るには、誤りがあったすべてのステップを特定し、各誤りについて妥当な説明を与える必要があります。部分点の扱いまでは本記事では確認していません。

スコアの推移が、このベンチマークのいちばん目立つ点です。2025年11月時点の首位は Claude Opus 4.5 の28%でした。その10か月後、GPT-6 Astra が80%で首位に立っています。Epoch はリード文でも「空間推論ベンチマークの首位スコアが10か月で28%から80%に跳ね上がった」と書いています。

ただしこれは特定のベンチマーク上の首位スコアの推移であり、能力一般の伸び率ではありません。この区別を落とすと、「10か月で3倍近く伸びているのだから、来年には何でもできる」という読み方になります。

速度についても記述があります。Astra は1枚あたりの中央値が3分で、Epoch が評価したモデルの中で最速、従来の首位モデルの2〜10倍速いとされています。そのうえで Epoch は、精度と応答の遅さがリアルタイム用途にはまだ制約だとしています。首位でありスコアが大きく伸びたモデルについて、作った側が「実務ではまだ制約がある」と書いていることになります。

作った本人が書いている限界

FAB のレポートで、選定の実務にとっていちばん役に立つのはスコアではありません。限界の記述です。

Epoch は、試したのが60枚・家具3種だけであるため、この結果が他の物理タスクにどれだけ一般化するかは不明だと明記しています。自分が作ったベンチマークについて、適用範囲が分からないと書いているわけです。

確かなこと:FAB の構成(家具3種・画像60枚)と、首位スコアが28%から80%へ推移したこと、Epoch が一般化可能性を不明としていること。これらはレポートの記載から直接確認できます。

まだ確かではないこと:このスコアが、自社の業務における有用性とどう関係するか。レポートはその関係について何も述べていません。「視覚と空間の把握が必要な業務なら80%の精度が出る」とは書かれていません。

もうひとつ、オープンウェイトのモデル(重みが公開され、自前で動かせるモデル)についての記述があります。Epoch は、FAB の首位は一貫してクローズドウェイトのモデルであり、中国のオープンウェイトモデルはフロンティアから遅れているとしています。遅れの幅はリード文で「約7か月」、本文の要点では「少なくとも7か月」と、表現に揺れがあります。自前で動かす前提で検討しているなら、この差が自社の要件に収まるかを見ることになります。ただし FAB 1本での観察であり、他のタスクで同じ差が出るとは書かれていません。

「飽和」という言葉は誰のものか

汎用ベンチマークの天井について語るとき、よく引かれるのが提供元が公表するスコアです。ここには注意すべき線引きがあります。

OpenAI は GPT-6 Astra について、FrontierMath Tier 4 を98%、ARC-AGI-3 を99.9%、ExploitBench を100%で「飽和させた(saturates)」と自社の発表ページに記載しています。数字も、「飽和」という評価語も、すべて提供元自身のものです。本記事は第三者による再現・検証を確認していません。

この区別は、揚げ足取りではありません。選定の場で「飽和しているので汎用スコアでは差がつかない」と説明するとき、その根拠が提供元の自己申告なのか第三者の測定なのかで、説明の強さが変わります。主語を落として「飽和している」と書いた瞬間に、自社公表値が業界の共通認識に見えてしまいます。

版数についても時点を添える必要があります。Astra が公開されたのは2026年9月3日です。その後 OpenAI は9月22日に GPT-6 Sol と Luna、9月29日に GPT-6.1 Sol を出し、10月7日には Sol と Luna の10月更新を出しています。つまり2026年10月9日時点で、Astra は OpenAI の最も新しいモデルではありません。選定の資料に特定の版数を書くなら、取得日を併記してください。この種の版数の取り違えは、実在する旧版を最も新しいものとして書いてしまう形で起こります。

どこから使えるかも、あわせて確認しておく項目です。Astra の提供は、公開時点では限られた組織向けに始まり、その後数日のうちに ChatGPT の Plus・Pro・Business・Enterprise の各プラン、および OpenAI の API(システム連携の窓口)・Microsoft Azure・AWS Bedrock 経由で利用可能になるとされました。どこから使えるかは、選定の実務では精度と同じくらい効く条件です。

飽和が選定に与える影響は、スコア差の縮小ではなく問いの置き換え

ここから先は、情報源が検証した主張ではなく、本記事が立てる仮説です。

汎用ベンチマークのスコアが上限に近づくと、「どのモデルが優れているか」という問いの差別化力が落ちていくのではないか。そして価値は、「自社のこの業務に、どのモデルとどの運用方法が向いているか」という個別の評価に移るのではないか、というのが仮説です。

FAB が示しているのは、この仮説の証明ではありません。示しているのは、汎用的でない軸を1つ作ると、まだ大きな差と大きな伸びが観測できるという実例です。家具の組立写真という、汎用ベンチマークのどれとも違う軸を立てたら、28%から80%という動きが見えた。軸の立て方次第で見えるものが変わる、という材料として読めます。

なお、本記事は「ベンチマークのスコアと本番の性能にギャップがある」という論点を扱っているわけではありません。それは別の問題としてAIエージェントは「ベンチマーク9割、本番6割」|導入前に見るべき指標の選び方で扱っています。本記事の論点は、ギャップの大きさではなく、汎用指標そのものの差別化力の低下です。2本は役割が違います。

判断軸:ベンチマークは足切りに使い、採否は自社タスクで決める

選定の順序を決めておくと、スコア表に引っ張られにくくなります。

  1. ベンチマークは足切りにだけ使う。「この種の処理が明らかに苦手なモデルを候補から外す」用途に限る。上位同士の数%差で採否を決めない
  2. 提供元の公表値と第三者の測定値を、資料の上で別の列に置く。混ぜない。公表値には「提供元公表」と書く
  3. 測っている内容が自社の業務と重なるかを、1行で説明できるか確かめる。説明できないなら、そのスコアは順位としては読めても採否の根拠にはならない
  4. 使えるかどうかは、精度以外の条件も並べる。応答にかかる時間、利用できる経路、自前で動かす必要があるか
  5. 最後は自社の業務で測る。次節の手順で足りる

2の線引きだけでも、選定資料の精度は変わります。能力の向上と信頼してよいかが別問題であるという論点は、AIの能力向上と「信頼していいか」は、なぜ別問題なのかでも扱っています。

本記事が扱わないことも書いておきます。モデル間の総合的な優劣には踏み込みません。本記事が参照したのは FAB のスコアと提供元の公表値だけで、横断的な比較の材料を持っていません。業務別・業界別のベンチマークが今後どう増えるかという見通しも、情報源に記述がないため扱いません。

最小の検証:自社の典型業務で10件を同じ条件で流す

スコア表を眺める時間を、こちらに振り替えたほうが判断は進みます。

  1. 自社の典型業務を1つだけ選ぶ。頻度が高く、品質の良し悪しを人が判定できるものにする
  2. 評価基準を先に書く。「何ができていれば合格か」を2〜3項目、試す前に文章にする。後から決めると、出力を見てから基準が動く
  3. 候補2モデルに、同じ入力10件を流す。入力は実際の業務から取る。作った例文ではなく、過去に実際に処理したものを使う
  4. 人が採点する。分子は基準を満たした出力の件数、分母は流した10件、単位は件/10件。モデルごとに同じ分母で比べる
  5. 差が小さければ、精度以外の条件で決める。応答時間、経路、費用の見通し

10件では統計的な結論は出ません。出るのは「自社の業務で見たときの印象が、スコア表の順位と一致しているか」という一点です。一致していないなら、スコア表はそのまま使えないという情報が手に入ります。一致しているなら、スコアを足切りに使う根拠が少し強くなります。どちらに転んでも、スコア表を眺めているだけの状態より前に進みます。

判断の土台として押さえておくこと

  • 上限に近いスコアが並んでいるとき、数%の差で採否を決める根拠はスコア表の中にはない
  • ベンチマークのレポートで最初に読むべきは、作った側が自分で書いている限界の記述である
  • 提供元が自社で公表した値と、第三者が測った値を混ぜない。「飽和」という評価語の出どころも確認する
  • 版数に触れるときは取得日を添える。発表の間隔が短い領域では、少し前の版が最も新しいものとして書かれやすい
  • 自社の典型業務10件を、先に決めた基準で人が採点する。これが選定の最後の一手である

選定の基準そのものが曖昧なまま候補を比べていると、どの数字を見ても決め手になりません。自社の業務のどこにAIを入れるかという前提から整理したい場合は、状況を言語化するところから始めることができます。

状況を整理する(15分)

より深く学ぶ

参考資料・引用元

  • Aiden Ament and Greg Burnham, Epoch AI, FAB(Furniture Assembly Benchmark)のレポート(ページ上の表記は "Report / Sep. 23, 2026"). https://epoch.ai/publications/furniture-assembly (2026年10月9日確認)
  • OpenAI, "GPT-6 Astra: A new generation of intelligence" (September 3, 2026). https://openai.com/index/gpt-6-astra/ (2026年10月9日確認)
  • OpenAI, "News" (発表の時系列を確認). https://openai.com/news/ (2026年10月9日確認)

よくある質問(FAQ)