每次新模型發表,網路上很快就會出現同一種問題:
Claude、GPT、Gemini、Grok,到底誰最強?
我以前也會直接找排行榜、比較分數,再替每家排一個名次。實際用 AI 寫過幾個完整專案後,我才發現這個問題少算了最重要的一半。
真正影響工作成果的,不只有模型智力,還包括:
- 它被放在哪一套 Agent 工具裡
- 能不能讀完整個專案、修改檔案和執行指令
- 長任務跑到一半會不會撞上配額或冷卻
- 回答速度快不快,失敗後要重試幾次
- 遇到正常技術需求時,會不會過度拒答
- 最後花掉的是幾美元,還是幾個小時的人力
所以這篇不再試圖選出一個「永遠的榜首」。我更想回答的是:如果目標不是聊天,而是真的把網站、程式或 Agent 任務做完,四個生態系各自適合放在哪裡?
本文資料與使用感受更新於 2026 年 7 月。模型、價格與方案變動很快,圖表只代表當時的快照。
先把四件事分開:模型、檔位、工具、配額
很多比較文最大的問題,是把四個不同層次混在一起。
模型不是產品的全部
同一個模型放在聊天網頁、API、IDE Agent 或命令列工具裡,體驗可能完全不同。
| 層次 | 真正要看的問題 |
|---|---|
| 模型能力 | 推理、寫碼、長文與多模態能力夠不夠? |
| Reasoning 檔位 | 是快速檔、平衡檔,還是願意花很久思考的最高檔? |
| Agent 工具 | 能不能讀 repo、改檔、跑測試、操作 Git 與部署? |
| 方案與配額 | 一個月實際能跑多少長任務?高峰期會不會降速? |
例如 GPT 家族內部就有不同定位與 reasoning 強度。只寫「GPT-5.6」而不說檔位與執行環境,資訊其實不完整。

圖:Artificial Analysis〈GPT-5.6 has landed〉中的模型分檔快照。
Claude Code、Codex、Antigravity、Grok Build 也不是模型名稱,而是讓模型真正「動手做事」的工作環境。比較 Agent 時,不能只比較背後的模型分數。
四個生態系的實際個性
先說結論:這四家都已經強到能完成大部分日常工作,差別主要出現在長任務、工具整合與使用摩擦。
Claude:穩定、會整理,但高強度使用成本明顯
Claude 的優勢一直很清楚:長文結構好、語氣穩定、閱讀大型程式碼時不容易失去上下文。需要寫文件、整理規格、審查架構或進行謹慎重構時,我仍然很願意用它。
Claude Code 也證明了 Anthropic 不只是做聊天模型。當工具能直接讀專案、執行指令和修改檔案後,Claude 的程式能力才真正變成生產力。
但它的缺點同樣直接:高階模型昂貴,長時間 Agent 任務很容易消耗大量配額。對每天都要讓 AI 在 repo 裡工作的人來說,「很強但捨不得一直開」就是實際限制。
我會在這些情況選 Claude:
- 長文、規格、技術文件與內容潤稿
- 需要保守修改的程式碼審查
- 複雜需求的第二意見
- 願意用較高成本換穩定表現的任務
GPT + Codex:適合長時間深入專案
GPT 生態最大的優勢不是單一榜單分數,而是工具完整度。從 ChatGPT 到 API,再到能操作實際工作目錄的 Codex,模型可以一路從討論需求走到修改、測試與交付。
在長時間的 repo 任務裡,Agent 是否願意持續調查、修錯、重新建置,往往比第一次回答漂不漂亮更重要。高 reasoning 檔位雖然可能等待較久,但適合需要數十分鐘持續推進的工作。
它的問題是產品與檔位很多,價格和用量不能只看模型名稱。官方 API、訂閱方案、第三方渠道與不同 reasoning 設定,成本可能差非常多。
我會在這些情況選 GPT/Codex:
- 多檔案重構與完整功能開發
- 需要長時間調查、測試、修復的 Agent 任務
- 要同時處理程式、圖片、文件等多種內容
- 希望從聊天一路接到實際專案操作
Gemini + Antigravity:價值在 Google 生態,風險也在方案機制
Gemini 如果只拿聊天視窗比較,很容易被低估。它真正有吸引力的地方,是長上下文、多模態以及 Google 文件、搜尋、雲端服務與開發工具的整合。
Antigravity 讓 Gemini 進入開發工作流後,評價標準也跟著改變:模型少幾分不一定重要,能不能把 Google 生態裡的資料和工作台串起來才重要。
但 Credits、冷卻時間與方案調整會直接中斷工作流。當一套工具已經融入專案,突然限額造成的成本,不只是少幾次請求,而是必須把上下文搬到另一套 Agent 裡重來。
我會在這些情況選 Gemini/Antigravity:
- Google Workspace、雲端與搜尋相關任務
- 超長文件、影音或多模態內容理解
- 已經以 Google 生態為主的開發流程
- 能接受 Credits 與方案變動風險的工作
延伸閱讀:AI 配額與方案變動筆記。
Grok + Grok Build:速度快、摩擦少,適合高頻率推進
Grok 的吸引力不是每一項評測都第一,而是整體使用摩擦低。回答通常直接、串流速度快,面對一般技術問題較少出現過度說教或不必要的拒答。
搭配 Grok Build 後,它也不再只是 X 裡的聊天工具,而是能進入 repo、修改檔案與執行工作的 Agent。對大量試作、腦力激盪和快速推進 side project 而言,這種「叫得動、跑得快、願意一直做」的體感很重要。
它的短板是生態成熟度仍不如 GPT,部分精細推理和大型重構也可能需要其他模型複核。
我會在這些情況選 Grok/Grok Build:
- 高頻率問答、研究與快速原型
- 希望減少拒答和對話摩擦
- 對速度與可持續使用量敏感
- 先快速完成,再交給另一個模型審查的工作流
排行榜有用,但不能直接替你做決定
Artificial Analysis 的 Intelligence Index、Coding Index 和速度/成本圖表,適合用來確認模型大致位於哪個梯隊。
但排行榜常有三個陷阱。
一分差距,未必等於實際工作差距
模型只要進入前沿梯隊,多數日常任務的差距已經不再明顯。真正拉開體驗的,可能是工具能否讀取專案、任務途中是否中斷,以及失敗時能不能自己恢復。
同模型換一個 Harness,結果就可能不同
Coding Agent 評測不只測模型,也測模型被放在哪套工具裡。提示詞、上下文管理、終端操作與錯誤恢復策略,都會影響最後分數。

圖:Artificial Analysis 的 Coding Agent 對照快照。Agent 工具本身也是能力的一部分。
榜單不會替你計算配額
一個榜首模型,如果每天只能認真跑少量長任務,對重度開發者未必比次一級、但能持續工作的模型更有效率。
因此我現在看榜單的方式是:
- 先確認模型有沒有進入可用梯隊
- 再比較 Agent 工具與穩定性
- 最後計算自己真正買得到的用量
成本不只是每百萬 Token 的價格
API 定價很好比較,但它只代表成本的一部分。
我更在意以下四種成本:
| 成本 | 說明 |
|---|---|
| 請求成本 | Input、Output、快取與 reasoning token 的價格 |
| 重試成本 | 第一次做錯後,要再燒多少輪才能修好 |
| 配額成本 | 冷卻、限速或突然改方案造成的中斷 |
| 切換成本 | 把專案背景重新交代給另一套 Agent 的時間 |
一個單價較低、但需要重做三次的模型,不一定便宜;一個很強、但在工作一半時耗盡配額的訂閱,也不一定划算。

圖:Artificial Analysis · Cost per Intelligence Index Task(2026-07-16)。任務成本通常比單看 Token 標價更接近實際體驗。
另外,官方 API、訂閱方案與第三方渠道的計費不能混為一談。看到一個任務只花幾美分,不代表所有人都能用相同價格取得相同模型;比較時必須先確認渠道、快取與計費規則。
速度要看「完成任務」,不是只看吐字速度
每秒輸出多少 Token 會影響聊天手感,但 Agent 任務更重要的是總牆鐘時間。
真正的完成時間大約是:
思考等待+ 工具呼叫+ 建置與測試+ 錯誤重試+ 人類重新說明需求= 任務完成時間
圖:Artificial Analysis · Output Speed(2026-07-16)。串流速度只是工作流中的一段。
有些模型首字很快,但需要來回修正;有些高 reasoning 模型會安靜思考很久,最後卻能一次完成更多工作。對長任務而言,後者不一定比較慢。
我現在會同時記錄三件事:
- 第一次可用結果要等多久
- 完成任務總共跑了幾輪
- 最後有沒有通過建置與實際驗收
使用限制與服務穩定性,也是產品能力
「審查嚴不嚴」很容易變成立場爭論。對開發工作來說,我更在意具體結果:正常需求是否能完成,以及服務規則是否可預期。
| 問題 | 對工作流的影響 |
|---|---|
| 正常技術問題被過度拒答 | 必須改寫提示或換模型 |
| 學生/低價方案移除高階模型 | 原有工作流突然失效 |
| Credits、限速或長冷卻 | Agent 任務被迫中斷 |
| 帳號、地區與付款限制 | 工具無法成為可靠主力 |
Claude 通常最保守;GPT 與 Gemini 的政策和方案層級較複雜;Grok 的對話限制相對少。但「限制少」不等於答案一定正確,重要內容仍然需要驗證。
對我而言,最理想的服務不是完全沒有限制,而是規則清楚、正常任務能穩定完成,而且不會每隔一段時間重寫配額邏輯。
我現在的選法:不是單押一家,而是分工
如果一定要替四家排出唯一名次,文章很快就會過時。更實際的做法,是替每個模型安排它最擅長的位置。
| 工作類型 | 我會優先考慮 | 原因 |
|---|---|---|
| 完整功能、多檔重構、長時間 Agent | GPT/Codex | 工具鏈完整,適合持續調查與驗證 |
| 文件、規格、審查與第二意見 | Claude | 結構穩定,長文與程式閱讀表現好 |
| Google 生態與多模態資料 | Gemini/Antigravity | Workspace、搜尋、雲端整合有優勢 |
| 快速研究、試作與高頻率推進 | Grok/Grok Build | 回應快、摩擦少,適合大量使用 |
| 隱私、離線與服務中斷備援 | 本機模型 | 不受帳號與雲端方案影響 |
我的實際工作流更接近:
Grok 快速發散與試作 ↓GPT / Codex 深入 repo、實作與測試 ↓Claude 做文字、架構或風險複核 ↓Gemini 處理 Google 生態與多模態任務 ↓本機模型作為隱私與斷線備援順序不是固定的,重點是不要要求一個模型同時扮演所有角色。
如果只能訂閱一套,怎麼選?
先不要問哪家分數最高,先回答自己一週花最多時間做什麼。
你的主要工作?├─ 長時間寫程式、修改 repo、跑 Agent│ → 優先看 GPT / Codex,也比較 Grok Build 的可用量├─ 長文、研究、規格與程式審查│ → Claude├─ Google 文件、搜尋、影音與雲端│ → Gemini / Antigravity├─ 快速問答、原型、低摩擦高頻使用│ → Grok└─ 預算極低或資料不能上雲 → 本機模型或 API 按量組合如果每月預算大約只有 20 美元,尤其要確認:
- 高階模型是不是方案常駐,而非限時提供
- Agent 與聊天配額是否分開
- 長任務會不會有冷卻或每日限制
- 超過配額後能否按量付費,而不是整套停用
- 自己是否真的需要最貴的模型處理所有工作
很多時候,「平衡檔當主力、最高檔只攻堅」會比每次都把 reasoning 拉滿更有效率。
最後答案:我不再選一個永遠的冠軍
如果只談模型能力,Claude 與 GPT 的最高檔通常仍在最前沿;Gemini 有其他家難以取代的 Google 與多模態整合;Grok 則用速度、使用摩擦與高頻率體驗形成自己的甜蜜點。
但我現在真正願意付費的,是一套能把任務推到完成的組合:
- Grok/Grok Build:快速想、快速試、保持推進速度
- GPT/Codex:進入專案,長時間實作、修錯與驗收
- Claude:需要穩定文字、審查與第二意見時使用
- Gemini/Antigravity:遇到 Google 生態和多模態工作再上場
- 本機 AI:保留隱私、離線與服務變動時的退路
榜首會換,方案會改,模型名稱也會不停增加。真正不會變的是:
好工具不是回答時看起來最聰明,而是能在你的預算與工作流裡,把事情可靠地做完。
延伸閱讀
Typelin · 2026-07-18 重寫
評論功能尚未開放