閲覧フィルタ(許可リスト)
以下のモデル名だけを表示。数値の発明・別取得はせず、各正本スナップショットに存在する行だけを使用。
- GPT-5.6 Sol
- GPT-5.6 Terra
- GPT-5.6 Luna
- GPT-6 Astra
- GPT-6 Sol
- GPT-6 Luna
- Grok 4.6
- Grok 4.7
DeepSeek(ソース別)
- AutomationBench: DeepSeek V4 Flash
- DeepSWE: DeepSeek V4 Flash, DeepSeek V4 Pro
- Artificial Analysis: DeepSeek V4 Flash Vision, DeepSeek V4 Pro
- CursorBench: DeepSeekなし(描画しない)
上の許可リストは既存4チャートのみ。VulcanBench Frontier v4 は許可リストを適用せず、そのスナップショットで score と cost が両方ある行をすべて表示する。
凡例タップでシリーズ表示切替。点をタップすると詳細(モデル / effort / score / コスト)。
Artificial Analysis
Artificial Analysis Intelligence Index (0–100) · as_of 2026-09-24
実際にプロット(36点): GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, GPT-6 Astra, GPT-6 Sol, GPT-6 Luna, Grok 4.6, Grok 4.7, DeepSeek V4 Flash Vision
スナップショットにない許可項目: なし
有効な score/cost がなく非プロット: DeepSeek V4 Pro
コスト比矢印: GPT-6 Luna→GPT-6 Sol: ×15.1 (Δscore +11) / GPT-6 Sol→GPT-6 Astra: ×3.1 (Δscore +5)
Artificial Analysis · as_of 2026-09-24 · https://artificialanalysis.ai/models
DeepSWE
Pass@1 % · as_of 2026-09-22
実際にプロット(26点): GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, GPT-6 Astra, Grok 4.6, DeepSeek V4 Flash, DeepSeek V4 Pro
スナップショットにない許可項目: GPT-6 Luna, GPT-6 Sol, Grok 4.7
有効な score/cost がなく非プロット: なし
コスト比矢印: このソースでは GPT-6 Luna→Sol→Astra の両端が揃わないため非表示
DeepSWE · as_of 2026-09-22 · https://deepswe.datacurve.ai/artifacts/v1.1/leaderboard-live.json
CursorBench
CursorBench 4.0 Correctness % · as_of 2026-09-23
実際にプロット(23点): GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, Grok 4.6, Grok 4.7
スナップショットにない許可項目: GPT-6 Astra, GPT-6 Luna, GPT-6 Sol
有効な score/cost がなく非プロット: なし
DeepSeek: このソースのスナップショットに行なし(描画しない)
コスト比矢印: このソースでは GPT-6 Luna→Sol→Astra の両端が揃わないため非表示
CursorBench · as_of 2026-09-23 · https://cursor.com/cursorbench
AutomationBench
Zapier AutomationBench task_completed_correctly % (LB v1.0.6) · as_of 2026-09-24
実際にプロット(37点): GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna, GPT-6 Astra, GPT-6 Sol, GPT-6 Luna, DeepSeek V4 Flash
スナップショットにない許可項目: Grok 4.6, Grok 4.7
有効な score/cost がなく非プロット: なし
コスト比矢印: GPT-6 Luna→GPT-6 Sol: ×8.5 (Δscore +11.3) / GPT-6 Sol→GPT-6 Astra: ×5.1 (Δscore +9.4)
AutomationBench · as_of 2026-09-24 · https://zapier.com/benchmarks
VulcanBench Frontier v4
Combined score (50% functional correctness, 8.5% lint and complexity, 8.5% security, 33% code quality) · as_of 2026-10-02
実際にプロット(49点): Fable 5.1, Opus 5.5, GPT-6 Astra, GPT-5.6 Terra, GPT-6.1 Sol, GPT-5.6 Sol, GPT-6 Sol, GPT-5.6 Luna, GPT-6 Luna, GPT-5.5
有効な score/cost がなく非プロット: なし
API-equivalent $/task at list rates from solver receipts. Every model ran on a subscription. This is not the subscription bill.
Frontier v4 は、以前 VulcanBench-SWE v4 と呼ばれていた同じ課題セットです。SWE v3 の次の世代、という読みはできますが、サイトは後継とは書いていません。点数に互換性はなく、SWE v3 とは別のグラフです。
コスト比矢印: GPT-6 Luna→GPT-6 Sol: ×25.2 (Δscore +5.4) / GPT-6 Sol→GPT-6 Astra: ×1.0 (Δscore +2.48)
VulcanBench Frontier v4 · as_of 2026-10-02 · https://vulcanbench.com/leaderboard.html