xAI(SpaceXAI)は 2026年7月8日、Grok 4.5 を正式リリースしました。coding・agentic tasks・knowledge work 向けの最上位モデルとして位置づけられ、Cursor との共同訓練、API list price の $2 / $6 per million tokens、Grok Build 既定モデルとしての提供が同時に示されています。

📑目次
  1. Grok 4.5リリース概要と公式が示す位置づけ
  2. Cursorでの使い方 — 提供面・effort levels・Composer 2.5との分担
  3. 価格・トークン効率・完了タスク単価の読み方
  4. 独立ベンチと公式主張の突き合わせ
  5. Grok 4.5 比較表(価格・提供面・評価)
  6. 導入チェックリストと注意点(EU・セキュリティ・検証)
  7. よくある質問(FAQ)
  8. まとめ

結論から言うと、Grok 4.5 の評価軸は「最強かどうか」ではなく、完了タスクあたりのコストと検証体制が合うかどうかです。独立評価では frontier 近傍に届きつつ、list price と token 効率で優位が強調されています。一方で EU 未提供、幻覚率の上昇報告、CursorBench 汚染の注記があり、全面置換より用途分担とレビュー工程の設計が先です。

この記事では、公式発表と独立評価を突き合わせ、Cursor での使い分け、料金の読み方、導入チェックリストまで整理します。


Grok 4.5リリース概要と公式が示す位置づけ

Grok 4.5 は、coding 専用モデルというより、ソフトウェアエンジニアリングと knowledge work をまたぐ上位モデルとして発表されました。公式は Cursor と「trained alongside Cursor」と明記し、Grok Build の既定モデル、Cursor 全プラン、console/API 導線を同時に案内しています。

速度は約 80 TPS と fast-model 級がうたわれ、トークン効率では leading model 比 roughly 2x / 半分以下の steps という主張があります。SWE-Bench Pro の平均 output tokens は公式図で Grok 4.5 約 15,954、Opus 4.8 (max) 約 67,020(約 4.2× fewer)と示されています。ベンチ図には DeepSWE 1.0 pass@1 62.0%、SWE Marathon resolution rate 29.0%、Terminal Bench 2.1 83.3%、SWE Bench Pro resolve rate 64.7% なども掲載されていますが、いずれも harness 条件付きの数値です。

導入上のブロッカーとして大きいのは EU 未提供です。SpaceXAI 製品・API console ともに EU では未提供で、mid-July 見込みとされています。EU チームはまず可用性を確認し、非 EU リージョンの利用方針を決める必要があります。

読者の判断軸は、ピーク知能の比較表を眺めることより、intelligence-per-cost と intelligence-per-time です。長時間エージェントで安い完了コストが取れるなら試す価値があり、逆に EU 制約や検証体制が未整備なら、Composer 2.5 や既存モデルを主軸に据えたまま部分導入が現実的です。


Cursorでの使い方 — 提供面・effort levels・Composer 2.5との分担

Cursor 側では、Grok 4.5 は desktop / web / iOS / CLI / SDK で即日利用可能とされています。individual / team プランに included usage があり、初週は double usage の案内もあります。まずモデル選択画面で Grok 4.5 が見えるかを確認し、代表タスクで1週間の A/B を回すのが最短の実務ルートです。

effort levels は High / Medium / Low です。難しい multi-step タスクは High、軽量な補完は Low に寄せ、compute をタスク難度に合わせます。base 価格は $2 / $6、fast variant は $4 / $18(priority serving)です。待ち時間よりスループット優先のジョブだけ fast を試し、常時 fast に寄せない方が試算しやすいです。

重要なのは、Composer 2.5 が消えないことです。Cursor は Composer 2.5 を coding specialist として継続提供し、Grok 4.5 を STEM / 研究 / knowledge work を含む広い mix の上位枠として位置づけています。全面置換ではなく、日常コーディングは Composer 2.5、長時間エージェントや横断調査は Grok 4.5、という役割分離が公式の意図に近いです。

注意点として、CursorBench には過去の Cursor codebase スナップショットが訓練データに誤混入し、数値が有利になっている注記があります。影響は完全には定量化できず、将来モデルでは除去予定です。採用判断を CursorBench 単独に依存しない方が安全です。


価格・トークン効率・完了タスク単価の読み方

API list price は入力 $2、出力 $6 per million tokens です。Artificial Analysis のモデルページでは cache hit 約 $0.5、入力 200k 超でコスト倍増の注記も確認できます。list price だけ見ると競合上位帯より安く見えますが、実務では「検証済みアウトカム1件あたりいくらか」が本丸です。

独立評価では、Intelligence Index がおおよそ $0.31 / task、Coding Agent Index(Grok Build harness)がおおよそ $2.5 / task 前後と報告されています。比較対象として、Fable 5 in Claude Code が約 $11.80、GPT-5.5 in Codex が約 $5.07 といった数値も並びます。token 量も少なく、Intelligence Index で output 約 14k / task(Opus 4.8 より 60% 超少ない)、Coding Agent Index で total tokens 約 1.9M(Fable 5 約 7.2M、GPT-5.5 約 6.2M)と整理されています。

公式の「約 4.2× fewer output tokens」と独立評価の cost/task は方向が一致しています。ただし harness が違うと比較は歪みます。自チームでは次の手順が再現しやすいです。

  1. 代表タスクを5〜10件選ぶ(バグ修正、リファクタ、テスト追加、調査付き実装など)
  2. 既存主力モデルと Grok 4.5(base / fast)で同じプロンプトを回す
  3. トークン請求・待ち時間・手動修正量・テスト通過を記録する
  4. cost-per-verified-outcome を1週間集計し、採用範囲を決める

生成が安くなるほど、レビュー・テスト・セキュリティ確認の相対コストが目立ちます。モデル料金だけを KPI にしないことが、導入後の後悔を減らします。


独立ベンチと公式主張の突き合わせ

Artificial Analysis の Intelligence Index では score 54 で 4位(上位は Fable 5、GPT-5.5、Opus 4.8)と報告されています。Grok 4.3 からの伸びは +16 です。GDPval-AA v2 は Elo 約 1543 で 4位前後、Coding Agent Index(Grok Build)は 76 で GPT-5.5 (Codex, xhigh) と同水準帯にあります。

公式ベンチは DeepSWE / Terminal Bench / SWE Marathon などで強みを示しますが、vendor harness と独立 harness は別物です。Grok Build で測った数値を、Claude Code や Codex 上の数値と単純比較すると順位が動きます。「公式が強い」と「独立評価で4位」は矛盾ではなく、評価軸の違いとして読むのが妥当です。

もう一つの実務ポイントは、AA-Omniscience Index で accuracy が上がる一方、hallucination rate が 25% → 54% へ上昇したという報告です。エージェントが長く動くほど、誤った前提を積み上げるリスクも増えます。diff レビュー、テスト、セキュリティチェックを外さない理由になります。

context window は 500k(Grok 4.3 の 1M から縮小)との注記もあります。巨大リポジトリを一度に載せたい用途では、分割・検索・要約の設計が必要です。


Grok 4.5 比較表(価格・提供面・評価)

項目 Grok 4.5 Claude Opus 4.8(比較参照) Composer 2.5(Cursor内)
API list price (approx.) $2 / $6 per M tokens 報道上 $5 / $25 帯 Cursor 内 first-party 枠
Fast / priority $4 / $18(Cursor fast) 各社 max 設定 日常向け軽量枠
提供面 Cursor全面 + Grok Build + API 各社 IDE / API Cursor 継続提供
独立評価の位置 AA Index 4位・コスト効率が強み 上位帯 別 weight class
主な注意 EU未提供・幻覚率上昇・CursorBench注記 高 list price / 高 token 最高知能枠ではない

出典:xAI Grok 4.5Cursor blogArtificial AnalysisDevOps.com(2026年7月時点)

表の読み方はシンプルです。Grok 4.5 は list price と完了タスク単価で攻め、Composer 2.5 は日常の軽量コーディングを担い、Opus 帯は高いが実績のある上位枠として残す、という三段構えが実務的です。


導入チェックリストと注意点(EU・セキュリティ・検証)

導入前に、次をそのままチェックリストとして使えます。

  • Cursor プランで Grok 4.5 が選択できるか(desktop / web / iOS / CLI / SDK)
  • 利用者が EU 在住・EU データ処理制約下にいないか(未提供なら mid-July 見込みを確認)
  • 対象タスクを切り分けた(長時間エージェント vs 日常補完)
  • base ($2/$6) と fast ($4/$18) の費用差を、同じタスクで試した
  • 出力 diff / テスト / セキュリティレビューの担当と完了定義を決めた
  • Composer 2.5 を残す用途(軽量・高速な日常編集)を決めた
  • 悪用対策強化の方針を理解し、正当な脆弱性調査用途との境界を確認した

セキュリティ面では、Cursor 側が cybersecurity capabilities を踏まえた safeguards を強化し、有害 workflow を制限しつつ正当な vulnerability discovery は残す方針を示しています。社内ポリシーと衝突しないか、セキュリティ担当と共有しておくと後工程が楽です。

独立報道でも指摘される通り、生成が安くなるほど検証コストが相対化します。モデルを安くした分だけ、CI・コードレビュー・権限管理に投資を戻す設計が必要です。


よくある質問(FAQ)

Q: Grok 4.5はCursorのどの面で使える?

Cursor の案内では desktop / web / iOS / CLI / SDK で利用できます。individual / team の included usage があり、初週は double usage の案内もあります。まずモデル選択で表示されるかを確認してください。

Q: $2/$6とfast $4/$18のどちらを選ぶべき?

既定は base の $2/$6 です。待ち時間より優先度の高いバッチや締切付きジョブだけ fast($4/$18、priority serving)を試し、常時 fast に固定しない方が cost-per-task を見誤いにくいです。

Q: Composer 2.5は不要になるのか?

不要にはなりません。Composer 2.5 は coding specialist として継続提供され、Grok 4.5 とは weight class が違います。日常の軽い編集は Composer 2.5、長時間エージェントや横断調査は Grok 4.5、という分担が自然です。

Q: EUでもすぐ使えるのか?

いいえ。xAI 公式は EU で SpaceXAI 製品・API console ともに未提供とし、mid-July 見込みとしています。Cursor フォーラム表記でも coming weeks です。EU チームは可用性確認が先です。

Q: 公式ベンチだけで採用してよいか?

推奨しません。公式ベンチは harness 依存が強く、CursorBench には訓練データ汚染の注記もあります。独立評価(例: Artificial Analysis の4位・cost/task)と、自チームの検証済みアウトカム計測を併用してください。


関連記事:

まとめ

Grok 4.5 は、frontier 近傍の能力と低い list price・高い token 効率を同時に提示するモデルです。最強断定ではなく、完了タスク単価と検証体制で採否を決めるのが実務的です。

次のアクションは次の5点です。

  1. Cursor で Grok 4.5 を1週間 A/B する
  2. base $2/$6 と fast $4/$18 のどちらが実ワークに合うか試算する
  3. EU 可用性を確認する
  4. Composer 2.5 との用途分離を決める
  5. 出力検証チェックリスト(diff / テスト / セキュリティ)を用意する

関連の背景として、Grok 4.5 のプライベートβ期や Cursor の Cloud Agents・料金設計を追うと、今回の GA 判断がしやすくなります。

krona23

著者

krona23

IT業界20年以上の実務経験を持ち、日本国内有数のPVを誇る大規模Webサービスで事業部長・CTOを複数社で歴任。Windows/iOS/Android/Webと技術の変遷を経験し、現在はAIネイティブへの変革に注力。DevGENTでは、AIコードエディタ・自動化ツール・LLMの実践的な使い方を日英西3言語で発信中。

DevGENT について →

コメントを残す

Trending

DevGENTをもっと見る

今すぐ購読し、続きを読んで、すべてのアーカイブにアクセスしましょう。

続きを読む