GPT-5は人間を超えたのか?2025年公開評価と実務での使いどころ

blue bright lights
Photo by Pixabay on Pexels.com

GPT-5の公開評価だけを根拠に、人間の総合知能を超えたと判断することはできません。

一方、数学、コーディング、画像と文章を組み合わせた理解など、正解条件が定まった課題では、2025年の発表時点で高い評価値を記録しました。

この記事では、数値が示す範囲と示さない範囲を分け、GPT-5を実務で使うときの判断基準を整理します。

公開評価から読める結論

  • 得意な領域:数学問題、コード修正、マルチモーダル理解など、入力と評価条件が明確な課題です。
  • 慎重に読む領域:長期の計画、課題そのものの発見、価値判断、結果への責任を含む仕事です。
  • 実務上の位置づけ:担当者を丸ごと置き換える仕組みではなく、範囲を区切った作業を速め、人が確認するための道具として扱うのが現実的です。

GPT-5はどのようなシステムだったのか

2025年8月の発表で、GPT-5は一つのモデルだけを指す名称ではなく、高速に応答するモデル、難しい課題を扱う推論モデル、それらを切り替える仕組みを組み合わせた統合システムとして説明されました。

モデルルーターとは、会話の種類、複雑さ、必要なツール、利用者が明示した意図などを見て、使うモデルを選ぶ仕組みです。

この構成は、簡単な依頼には速く答え、難しい依頼には多くの計算を割り当てる考え方です。詳しい構成は、OpenAIのGPT-5 System Cardで確認できます。

ベンチマーク値と読み方

ベンチマークとは、同じ問題と採点方法を使い、モデルの性能を比較する試験です。

ベンチマークは特定条件での強さを示しますが、職場で行う仕事全体の成果や、人間との総合比較をそのまま証明するものではありません。

2025年8月のOpenAI公式発表に掲載された主な評価値
評価 公表値 測る内容 読むときの注意
AIME 2025 94.6%(ツールなし) 高校数学競技の問題を解く力 ツールを使う条件の結果と直接比較しません。
SWE-bench Verified 74.9% 課題説明からコードの修正パッチを作る力 固定された477件で評価され、実際の開発環境とは条件が異なります。
Aider Polyglot 88% 複数の言語でコード差分を作る力 完了条件が明確なコード編集の評価です。
MMMU 84.2% 画像と文章を組み合わせて理解する力 個別の業務資料で同じ精度になるとは限りません。
HealthBench Hard 46.2% 難しい健康相談への応答 医療従事者による診断や治療を代替する評価ではありません。
GPQA GPT-5 Proで88.4%(ツールなし) 大学院水準の科学分野の質問応答 拡張推論を使った別設定の結果です。

各数値と評価条件は、OpenAIのGPT-5発表ページに掲載されています。

事実誤り率の改善は無誤りを意味しない

OpenAIは、Web検索を有効にした実利用に近い評価で、GPT-5の回答はGPT-4oより事実誤りを含む割合が約45%低く、推論時はOpenAI o3より約80%低かったと報告しました。

これは比較対象と評価条件を固定した相対値であり、どの質問にも正しく答える保証ではありません。

業務では、出典の確認、計算の再実行、元データとの照合を省く理由にはなりません。

「人間を超えた」を三つに分ける

人間超えという表現は、比較する範囲を決めないまま使うと誤解を招きます。

  1. 個別課題での比較:数学問題やコード修正など、正解と採点条件が定まった課題を比べます。GPT-5の公開値が示す強さは、主にこの範囲です。
  2. 業務工程での比較:依頼の理解、設計、実行、検証、報告までを継続して完了できるかを比べます。途中で条件が変わる仕事では、進め方の監督も必要です。
  3. 総合的な判断での比較:何を課題にするか、誰への影響を優先するか、失敗時にどう責任を取るかまで含めます。公開ベンチマークは、この範囲を測っていません。

GPT-5は一部の試験で高い性能を示しましたが、その結果だけから人間の職能や総合知能を超えたとは結論できません。

長期作業と安全面の限界

GPT-5 System Cardは、モデルが自らAI研究を進める能力を調べた複数の評価で改善が見られた一方、OpenAIのHigh閾値には達しなかったと説明しています。

短い課題で高得点を取ることと、長期プロジェクトを安定して運営することは別の能力です。

依頼内容が曖昧なまま長く作業させるほど、途中の判断や前提のずれを人が見つける仕組みが必要になります。

safe-completionsが変えた安全訓練

safe-completionsは、質問を許可するか拒否するかだけで判断せず、出力内容の安全性を制約しながら、可能な範囲で役立つ回答を返すための訓練方法です。

危険な詳細には答えず、一般的な注意や安全な代替案を示す動作が、この考え方の例です。

OpenAIは、GPT-5の会話モデルと推論モデルにこの方法を導入したとsafe-completionsの解説で説明しています。

生物と化学の能力については、深刻な危害を可能にする決定的な証拠があるためではなく、予防的な判断としてHigh能力向けの安全策が適用されました。

業務導入を判断する五つの手順

  1. 対象作業を一つに絞る:コードの修正案、資料の要点抽出、文章の差分確認など、完了条件を説明できる作業から始めます。
  2. 入力してよい情報を決める:個人情報、顧客情報、未公開情報など、外部サービスへ渡してよい範囲を組織の規程に沿って定めます。
  3. 期待する出力を固定する:形式、必要な根拠、禁止事項、不明時の扱いを具体的に指定します。
  4. 人の確認点を置く:公開、送信、診断、契約、支払いなど影響の大きい操作は、担当者が根拠と結果を確認してから進めます。
  5. 同じ条件で評価する:モデル名、利用日、ツールの有無、入力例、正解条件、修正回数を残し、変更前後を比較します。

運用責任を先に決めたい場合は、「生成AIを業務に入れる前に決めるべきこと」も参考になります。

用途別の使いどころと確認点

コーディング

再現手順、対象ファイル、期待するテスト結果がそろった不具合修正は、範囲を区切りやすい用途です。

生成された差分は、依存関係、権限、エラー処理、既存テストへの影響まで開発者が確認します。

支援ツールを比べるときは、「ClineとCursorの違いと使い分け」で導入方法とレビュー手順を確認できます。

調査と文書作成

複数資料から論点を抽出し、出典の位置と未確認事項を一覧にする作業は、担当者の初読を助けます。

出典が実在するか、引用内容が原文と一致するか、日付が古くないかは、元資料を開いて確認します。

医療、法務、安全に関わる情報

質問項目の整理や一般情報の要約には使えても、診断、処方、契約判断、安全に関わる実行判断を任せることはできません。

対象分野の専門家が確認し、利用者が専門機関へ相談できる導線を残します。

よくある疑問

GPT-5はAGIだったのですか

この記事で確認した公式資料は、GPT-5をAGIと認定していません。

公開値は個別の評価課題での性能を示すものであり、課題発見、価値判断、長期的な責任まで含む総合知能の証明ではありません。

ベンチマークが高ければ、そのまま導入できますか

導入前に、自社の入力データと完了条件を使った評価が必要です。

公開試験と実務では、データの形式、例外、権限、許容できる誤りが異なるためです。

誤りが減ったなら、人の確認は不要ですか

不要にはなりません。

公表された改善率は特定条件での相対比較であり、個々の回答の正しさを保証しないため、影響の大きさに応じた確認を残します。

GPT-5を実務で評価するときの結論

GPT-5の強みは、条件を定めた課題で高い性能を示し、コード修正、情報整理、文書作成などの作業を支援できる点にあります。

ただし、ベンチマークの得点は、業務全体の完了や人間の総合判断を置き換える証拠ではありません。

対象作業を絞り、入力範囲、完了条件、確認責任、評価記録を先に設計すれば、性能を過大評価せずに実務上の価値を測れます。

参考資料

この記事に関連する株式会社greedenの取り組み

GPT-5を業務で生かすには、得意な作業を選び、確認責任と評価方法を含む運用設計が必要です。株式会社greedenは、AI活用の相談からツール選定、業務フロー改善、システム実装、定着支援まで伴走します。

投稿者 greeden

コメントを残す

メールアドレスが公開されることはありません。 が付いている欄は必須項目です

日本語が含まれない投稿は無視されますのでご注意ください。(スパム対策)