模型能力

從綜合智慧到實際使用成本與回應體驗,按八個維度了解模型能力。

01

綜合智慧

綜合比較推理、程式設計與知識工作能力。

© Artificial Analysis · 2026-09-27Intelligence Index v4.3.2
分數越高越好。該指數彙總 10 項評測,用於能力比較,不代表任務通過率。

圖表解讀

本組模型中,Opus 5.5 以 58 分領先,Fable 5.1 與 GPT-6 Astra 均取整為 53 分。比較時應保留圖中推理檔位。

02

專項能力

分別查看程式設計、推理、事實知識、長上下文與視覺理解表現。

展開 19 項專項評測原圖19 項評測 · 獨立計分

圖表解讀

不同任務的領先模型會變化。程式設計可看 Terminal-Bench 與 SciCode,長上下文推理看 AA-LCR,視覺推理看 MMMU-Pro。

03

Agent 工作能力

評估 Agent 能否將複雜需求轉化為可用的工作成果。

© Artificial Analysis · 2026-09-27AA-Briefcase v1.1 · Elo
分數越高越好。AA-Briefcase 綜合評分標準通過率、分析品質和呈現效果;Agent 工具與執行設定也會影響結果。

圖表解讀

本組模型中,Opus 5.5 達到 1822 Elo,隨後是 Fable 5.1 的 1678 和 Grok 4.7 的 1657。

04

能力與成本

在所需能力與單任務成本之間找到合適平衡。

© Artificial Analysis · 2026-09-27智慧指數 · 美元/任務 · 對數座標
成本為考慮 Token 消耗的加權評測任務成本,橫軸使用對數刻度;此處數值不代表本站 API 報價。

圖表解讀

越靠近左上方,能力越強、成本越低。虛線前沿幫助識別這組模型中兼顧能力與成本的選擇。

05

Token 效率

觀察完成一次評測任務需要多少推理和答案 Token。

© Artificial Analysis · 2026-09-27加權平均輸出 Token/任務
更少的 Token 可能降低費用與等待時間,但不能據此判斷品質更好,需要結合智慧指數和 Token 單價。

圖表解讀

Opus 5.5 每任務約輸出 119k Token,GPT-6 Sol 約為 31k;推理 Token 占據了較大比例。

06

上下文容量

比較可容納文件、程式碼與歷史對話的上下文空間。

© Artificial Analysis · 2026-09-27上下文視窗 · Token
視窗大小表示容量上限,不等於理解效果。長文件任務還應參考 AA-LCR,並核對供應商的輸入、輸出限制。

圖表解讀

本組許多模型的上下文約為 1M Token;圖中 Grok 4.7 為 500k,Mistral Medium 3.5 為 256k。

07

輸出速度

比較開始生成後,文字持續輸出的速度。

© Artificial Analysis · 2026-09-27輸出 Token/秒 · 輸入 10k Token · 單請求
速度越高越好。此指標不包含開始輸出前的等待時間,不等同於任務總耗時,也不是本站吞吐量承諾。

圖表解讀

本組 Gemini 3.5 Flash-Lite 達到 337 Token/秒,high 檔位的 Gemini 3.8 Flash 為 285 Token/秒。更高輸出速度有利於長答案的持續生成。

08

首答案延遲

了解使用者收到第一個答案 Token 前需要等待多久。

© Artificial Analysis · 2026-09-27秒 · 包含思考 · 輸入 10k Token · 單請求
延遲越低越好。此指標包含推理時間,與首 Token 延遲不同;應在相同推理檔位和 API 供應商口徑下比較。

圖表解讀

圖中 xhigh 檔位的 Grok 4.7 為 54.4 秒,max 檔位的 GPT-6 Astra 為 292.2 秒。思考時間可能成為使用者等待的主要部分。

圖表保留來源的模型選擇與推理檔位;未展示的模型或缺失指標不代表得分為零。

原始圖表來自 Artificial Analysis。本頁解讀為選型參考,重要選擇應結合自己的真實任務驗證。