「第三者評価済み」だけでは判断できない|AIの外部評価は、主張・アクセス・公開の条件で中身が決まる
AIベンダーを選ぶとき、提案資料に「外部の第三者評価を受けています」と書かれていると、安全性の確認が1つ済んだように感じます。社内の稟議でも「第三者評価あり」は通りのよい一行です。
ただ、この一行から分かるのは外部の誰かが何かを確かめたということだけです。何を確かめたのか、確かめるためにどこまで中を見られたのか、見つかったことをどこまで表に出せたのか。この3つが分からないと、同じ「第三者評価済み」でも中身はまったく違いえます。
この記事では、OpenAIが2026年9月22日に公開した文書「Priorities and principles for effective third party assessments」を材料に、第三者評価を判断材料として使うときの確認の順序を整理します。
30秒で要点
- 「第三者評価済み」は評価があったことを示すだけで、評価の中身までは示さない
- OpenAIの文書は、効果的な第三者評価の原則として7項目を挙げている。「誰が評価したか」にあたる専門性と独立性はそのうちの1項目で、主張(claims)の範囲、アクセス、公開の扱いは別の項目として並ぶ
- 同じ文書は、評価される企業が主張したいことと、評価者が独立に確かめたいことを区別している
- 評価者に渡すアクセスの深さや、発見の公開の扱いも、原則の項目として並んでいる
- 確認の順序は「何を主張として評価したか → そのためのアクセスは足りたか → 発見を公開できたか」(筆者の整理)
| 用語 | 意味 |
|---|---|
| 第三者評価(third party assessment) | 評価される企業とは別の組織が、その企業の製品や主張を確かめること |
| 主張(claims) | 評価によって正しいかどうかを確かめる対象となる言明。「このモデルは〇〇の用途で安全に使える」など |
| アクセス | 評価者が、評価のためにモデルやデータ、社内の仕組みをどこまで見たり操作したりできるか |
この文書は「評価される側」が書いたものである
最初に、材料の性質をはっきりさせておきます。
この文書は、第三者評価を受ける側のAI開発企業が、自ら公開したものです。評価者の団体や規制当局が定めた基準ではありません。したがって、ここに書かれていることが業界の標準になっている、あるいは他社も同じ考え方をとっている、とは言えません。
それでも材料にする理由は、評価を受ける側が「効果的な評価の条件」を項目として書き出している点にあります。受ける側が挙げた条件は、裏を返せば、評価を見る側が確かめるべき点の一覧として読めます。本記事はこの読み方をとります。
なお、本記事は原文の見出しと要旨の記録に基づいて書いており、7つの原則それぞれの本文の説明には踏み込みません。
何を評価するのか:文書が挙げる4つの優先領域
文書はまず、第三者評価を優先して向けるべき領域として4つを挙げています(訳は筆者)。
- 訓練・評価・社内外への展開にまたがる safety cases(安全性についての主張と、その根拠のまとまり)の独立した評価
- 社内外への展開における critical safeguards(重要な安全対策)の評価
- 同社の「Preparedness」のリスク区分と、alignment evaluations(モデルが意図どおりに振る舞うかの評価)を対象にした capability evaluations(能力の評価)そのものの評価
- critical misalignment incidents(モデルが意図に反して振る舞った重大な事案)の独立した調査
ここで注目したいのは3番目です。モデルを直接評価するのではなく、能力評価という「評価そのもの」を評価するという二重の構造になっています。第三者評価と聞くと、外部の専門家がモデルを一から試験する姿を思い浮かべがちですが、「評価のやり方を外から確かめる」という形も優先領域に含まれているわけです。
7つの原則のうち「誰が評価したか」は1項目にすぎない
文書は、効果的な評価の原則として次の7つを見出しに掲げています。
| 原文の見出し | 筆者訳 |
|---|---|
| Clearly scoped and mutually agreed-upon claims | 範囲が明確で、双方が合意した主張 |
| Proportionate access | 釣り合いのとれたアクセス |
| Transparent methodology and standards | 透明な方法と基準 |
| Expertise and independence | 専門性と独立性 |
| Security and confidentiality | セキュリティと機密性 |
| Actionable findings and time to remediate | 対処可能な発見と、是正のための時間 |
| Responsible publication practices | 責任ある公開のやり方 |
「誰が評価したか」にあたるのは Expertise and independence(専門性と独立性)の1項目です。残りの項目には、何を評価の対象にするか(主張の範囲)、どこまで見せるか(アクセス)、見つけたことをどう扱うか(発見と公開)が並んでいます。
文書は、評価の対象となる主張について、評価される企業が主張したいものと、第三者の評価者が独立に評価しようとするものの両方がありうると区別し、範囲は双方の合意で決める立て付けにしています。
この区別は、評価を読む側にとって重要です。企業が「この用途では安全だ」と主張したい範囲だけを評価したのか、評価者が自分の問題意識で範囲を広げたのかで、「評価済み」の意味が変わるからです。
どこまで見せるか:アクセスの深さも条件の一部
アクセスについて、文書は訓練・評価・展開にわたる深いアクセスに触れ、具体例として次のようなものを挙げています。
- visible chain of thought access:モデルが回答に至る推論の過程を見られるアクセス
- confidential data and internal deployment access:機密データや、社内向けに展開されている仕組みへのアクセス
- grey box access:敵対的なテスト(わざと問題を起こさせようとする試験)向けの、内部の一部が見える状態でのアクセス
さらに、直接のアクセスが現実的でない場合は、間接的な方法やプライバシーを保つ仕組み(indirect or privacy preserving access mechanisms)で代わりにしうる、としています。
これらが「浅い→深い」の段階として並べられているのかは、本記事の材料からは読み取れません。ただ、少なくともアクセスの種類によって確かめられることが変わるとは考えられます。回答だけを外から見る評価と、推論の過程まで見られる評価とでは、同じ主張を検証していても、見落としうるものが違います。
見つけたことを、どこまで出せるか
7つの原則には「責任ある公開のやり方」も含まれています。また文書は、評価者の編集上の独立性に触れつつ、機密性と知的財産の保護を確保するという条件を併記しています。
ここから、評価者が問題を見つけても、その書き方や出し方には、評価される側の機密や知的財産との調整が入りうる、と読めます。評価報告の要約だけを見て「重大な指摘はなかった」と受け取る前に、どこまで書ける取り決めだったのかを確かめる必要があります。
なぜ「誰が評価したか」だけで判断してしまうのか
こうした取り違えが起きやすい理由は、2つあると考えています。
1つ目に、評価者の名前は見えるが、条件は見えないから。提案資料に載りやすいのは評価機関の名前で、範囲・アクセス・公開の取り決めは、資料の表には出てこないことが多いと筆者は見ています。見えている情報だけで判断すると、自然と「誰が」に重みが寄ります。
2つ目に、「第三者」という言葉が独立性を連想させるから。外部の組織である以上、中立に厳しく見たはずだと感じやすくなります。しかし上で見たように、範囲は双方の合意で決まり、アクセスも公開も取り決めの対象です。外部であることと、確かめたい点を確かめられたことは、別の問題です。
ここから先は仮説です。外部の評価を入れても判断が変わらない案件は、評価者の力量より、評価の対象とする主張の切り出し方で結果がほぼ決まっているのではないか、と筆者は考えています。確かめたい問いが最初から範囲に入っていなければ、どれだけ優れた評価者でもその問いには答えません。
確かなことと、まだ確かではないこと
本記事の材料から言えること:
- OpenAIが2026年9月22日に第三者評価の優先領域と原則をまとめた文書を公開したこと
- 同文書が優先領域4つと原則7つを挙げ、主張の区別・アクセスの例・公開と機密の併記に触れていること
言えないこと:
- この文書の考え方が他社や評価機関に採用されているか
- OpenAIが実際にどの評価機関と、どのような条件で評価を行っているか
- 各原則の本文で、具体的に何が求められているか
- 法規制との関係
筆者の解釈であること:
- 確認の順序を「主張 → アクセス → 公開」とした整理
- AI以外の分野(セキュリティ監査や業務委託先の評価など)にも同じ見方が使えるかもしれない、という一般化。これは検証していない仮説です
ベンダーに確認する3つの問い
次に「第三者評価を受けています」という資料を受け取ったら、次の3つを順に聞いてみてください。
- その評価は、どの主張が正しいかを確かめたものですか。範囲を決めたのは誰で、評価者が独自に加えた問いはありましたか
- 評価者には、どこまでのアクセスを渡しましたか。回答だけを見る形か、内部の過程や社内の仕組みまで見られる形か。直接見せられない部分は、どう代わりにしましたか
- 見つかったことは、どこまで公開できる取り決めでしたか。公開された要約と、評価者が見つけたことの全体との間に、どんな調整がありましたか
この3つに答えが返ってこなければ、その「第三者評価済み」は、稟議の一行以上の判断材料にはなっていないと考えてよいでしょう。逆に、3つともはっきり答えられるベンダーであれば、評価の中身について踏み込んだ比較ができます。
評価の範囲と組み立てが結論を左右する例としては、AIが差別的かどうかは「監査の作り方」で変わるが参考になります。ベンダー自身が出した数字と独立機関の数字の違いはベンダーが出した数字と、独立機関が出した数字で、AIの影響評価を規格として扱う動きはAIの「影響評価」がJISになったで扱っています。
この記事で扱ったような判断を、自社の状況に照らして整理したい場合は、無料診断ツールで状況を言語化するところから始めることができます。
状況を整理する(15分)