6 min read

GPT-5.4 登場 — native computer use で人間基準を超え、エージェント時代が本格化

openaigptai-agentscomputer-usellm

概要

2026年3月5日、OpenAI が GPT-5.4 を発表した。「プロフェッショナルワークにおける最も有能かつ効率的な frontier model」と位置づける。

最大の特徴は native computer use。GPT-5.4 は初の汎用モデルとして、PC の画面を見てマウスとキーボードを操作し、複雑なワークフローを自律実行できる。OSWorld-Verified benchmark で 75.0% を記録し、OpenAI が提示した人間基準の 72.4% を初めて超えた。

同日、ChatGPT for Excel(beta)も発表。Excel アドインとして GPT-5.4 が直接ワークブック内で動作する。

主要スペックと機能

モデル仕様

項目GPT-5.4
リリース日2026年3月5日
標準コンテキスト272K tokens
Codex 経由最大 1M tokens
最大出力128K tokens
API 入力単価$2.50 / 1M tokens
API 出力単価$15.00 / 1M tokens
272K 超過時の入力単価$5.00 / 1M tokens(2倍)

主要機能一覧

機能概要提供チャネル
Native Computer Useスクリーンショット認識 + マウス/キーボード操作Codex / API
GPT-5.4 ThinkingMid-response steering(思考中に軌道修正)chatgpt.com, Android
1M Token Context長大なリポジトリ・ドキュメントを一括処理Codex 経由
Tool SearchMCP サーバーを動的に選択し不要なコンテキストを削減API
ChatGPT for Excelワークブック内で直接 GPT-5.4 を呼び出すChatGPT Plus 以上(beta)

Benchmark — 特に computer use が突出

BenchmarkGPT-5.4GPT-5.2人間基準
OSWorld-Verified(computer use)75.0%47.3%72.4%
SWE-bench Pro(コーディング)57.7%
Graphwalks BFS 0–128K93.0%
Graphwalks BFS 256K–1M21.4%

OSWorld は PC 上の実際のタスク(ファイル操作、ブラウザ操作、アプリ間連携)を AI が自律実行できるかを測る benchmark。75.0% は人間の 72.4% を上回る初のケースだ。

GPT-5.4 Thinking — 思考中に介入できる

従来の Thinking モデルは「考えてから答える」構造だった。GPT-5.4 Thinking は mid-response steering を導入した。

モデルが複雑なタスクを処理し始める前に、アプローチの概要(プラン)を先に表示する。ユーザーはそのプランを読んで修正指示を出せる。最終出力が来る前に方向を変えられるため、余計なトークンを消費せず、プロンプトを書き直す手間も省ける。

ユーザー: このコードをリファクタリングして

GPT-5.4 Thinking:
[プラン表示]
1. 共通ロジックを関数に抽出
2. エラーハンドリングを統一
3. テストを追加

↑ここでユーザーが介入できる

ユーザー: 2と3はスキップ、1だけでいい

→ 1だけを実行して出力

Tool Search — MCP サーバーの動的選択

OpenAI は Scale の MCP Atlas benchmark(36 MCP サーバー、250 タスク)で GPT-5.4 の tool search を評価した。

  • 全サーバーを常時有効にした場合 vs. 必要なサーバーを動的に選択した場合
  • 動的選択で トークン使用量 47% 削減、精度は同等

MCP(Model Context Protocol)の普及が進む中、膨大な外部ツールをどう効率的に呼び出すかは実運用の課題だった。GPT-5.4 はモデルレベルでこれを解決している。

ChatGPT for Excel — ホワイトカラーへの直接攻撃

ChatGPT for Excel は Excel アドインとして GPT-5.4 を直接ワークブックに統合する。財務モデルの構築、DCF のアップデート、バリュエーション資料の生成などを自然言語で指示できる。

現在のベータ提供は 米国・カナダ・オーストラリア のみ。ChatGPT Plus 以上のプランが対象で、Enterprise / Edu 向けはデフォルト無効(管理者が有効化)。

日本への示唆

computer use の到達点が変えること

PC 操作の自律化は今まで「RPA でやること」だった。GPT-5.4 の computer use は手順書なしで動く。SaaS の画面、レガシー Web システム、デスクトップアプリを問わない。

日本のエンタープライズは RPA(UiPath, WinActor 等)への依存が高い。GPT-5.4 ベースのエージェントが普及すれば、ルール記述型 RPA の存在意義は問われる。

観点従来の RPAGPT-5.4 computer use
セットアップフロー設計が必要自然言語で指示
変更対応画面変更のたびに修正視覚的に再認識
適用範囲定型タスクのみ判断を含む複合タスク
導入コストAPI コストのみ

ChatGPT for Excel が日本に来るとき

現時点では日本未対応だが、この機能は Excel が業務の中核を占める日本企業に直撃する。財務・経理・IR 部門での Excel 作業は依然として膨大だ。日本展開は時間の問題で、展開時には業務フローの見直しを迫られる企業が続出する。

API コストの構造変化

272K トークンを超えると入力単価が倍になる。リポジトリ全体や長大なドキュメントを処理するワークロードは、1M コンテキストと価格設計を慎重に考慮する必要がある。

# 272K token 超過のコスト試算
input_tokens = 500_000  # 50万トークン
base_rate = 2.50        # $/1M tokens
over_rate = 5.00        # 272K超過後

cost_within = (272_000 / 1_000_000) * base_rate       # $0.68
cost_over   = (228_000 / 1_000_000) * over_rate        # $1.14
total_input = cost_within + cost_over                  # $1.82

# 272K以内なら: (500K / 1M) * $2.50 = $1.25
# 超過すると 46% 高くなる

まとめ

ポイント内容
computer use が人間超えOSWorld 75.0% で人間基準 72.4% を初めて超えた
1M コンテキストCodex 経由で利用可。272K 超過後は単価 2 倍に注意
Thinking の mid-response steering最終出力前にユーザーが方向修正できる新機能
Tool SearchMCP 動的選択でトークン 47% 削減
ChatGPT for Excel英語圏 beta。日本展開は未定だが時間の問題

エージェントが「人間並みに PC を操作できる」段階に入った。RPA 市場と Office ワーカーの業務設計は、この転換点から再評価が始まる。

参考リンク