4126 字
21 分钟
[8/20 更新] 實測!6 個模型跑相同 Prompt:誰是野狗誰是豆包?是小男梁還是梁太祖?GPT、Gemini、Grok、Deepseek批鬥大會。
實測主流模型跑相同 Prompt!深度復盤 grok2api 自建中轉與 xAI IP 降智假說、真 Grok 4.6 官方 Build 滿血補測與降智前後震撼對比、DeepSeek V4 系列評測爭議,以及 Gemini 3.7 Flash 在「鵜鶘騎自行車 SVG 動畫」實戰中的具體表現。

這幾天在自建 grok2api 轉發服務,並密集測試新出的 DeepSeek V4 系列與 Google Gemini 3.7 Flash 後,我深刻體會到模型宣傳跑分與實際工程落地之間的巨大斷層。

很多時候,排行榜上的高分並不能直接轉化為日常生產力。真正決定一個模型能否放進開發工作流的,往往是長上下文下的穩定性、是否有隱蔽的風控降階、多輪代碼生成的空間幾何閉環能力,以及調用成本與推論延遲。

本文結合第三方評測機構 Artificial Analysis 的 Intelligence Index v4.1.1 基準數據、GitHub 專案 Issues 實錄,以及我親自執行的「鵜鶘騎自行車 SVG 2D 動畫」橫向代碼壓測,記錄這波模型變局下的真實實測反饋與工程選型觀察。


一、 基準數據:Artificial Analysis Intelligence Index v4.1.1#

脫離官方宣傳濾鏡後,客觀第三方評測是觀察模型基礎智能的重要參考。根據 Artificial Analysis 於 2026 年 8 月最新公布的 Intelligence Index v4.1.1(綜合納入 GDPval-AA v2、Terminal-Bench v2.1、SciCode 等 9 項嚴苛基準),當前全球主流模型的得分分佈如下:

Artificial Analysis Intelligence Index v4.1.1 評測排行榜

數據來源:Artificial Analysis Intelligence Index (2026-08)

梯隊實力與得分分佈#

梯隊定位代表模型綜合智能分 (AA Index)工程實務定性
頂級旗艦Claude Opus 5 (max)
Claude Fable 5
GPT-5.6 Sol (max)
Grok 4.6 (high)
Kimi K3 (max)
63
62
61
61
60
適合複雜架構重構與科研推理,但調用成本高且延遲較大。
主力實戰Qwen3.8 Max
Muse Spark 1.2 (xhigh)
GPT-5.6 Terra (max)
Gemini 3.7 Flash (high)
58
57
57
56
性價比與速度的主戰場,Gemini 3.7 Flash 拿到 56 分,成為近期最大亮點。
爭議與輕量DeepSeek V4 Pro 0813 (max)
GLM-5.2 (max)
GPT-5.6 Luna (max)
Motif 3
MiniMax-M3
53
53
52
47
45
DeepSeek V4 Pro 僅獲 53 分,與 Flash 版本未能拉開實質代差。
邊緣基座Nemotron 3 Ultra
Gemini 3.5 Flash-Lite
Solar Open2 250B
38
37
37
僅適合輕量摘要與超低延遲邊緣任務,不建議用於 Agent 開發。

2026 年 8 月主流 AI 模型實測跑分與性價比對比卡片

從基準數據來看,有兩個顯著的趨勢:

  1. Gemini 3.7 Flash (High) 取得了 56 分,直接跨過了 DeepSeek V4 Pro(53 分)與 GPT-5.6 Luna(52 分),緊追第一線大模型。
  2. DeepSeek V4 Pro(53 分)相比宣傳預期出現顯著落差,並未展現出旗艦級的代差優勢。

二、 自建 grok2api 與 Grok 4.6/4.5 的「IP 降智」謎題#

為了降低 API 成本,許多開發者基於開源專案 chenyme/grok2api 搭建了中轉服務,將 xAI 的 Web/Build 接口轉換為標準 OpenAI 格式。

但在使用過程中,大量自建節點的使用者反饋 Grok 4.6 與 4.5 出現了斷崖式降智:基礎邏輯判斷頻繁出錯、代碼遺漏括號、稍微複雜的多檔案上下文直接崩潰。相反地,只要切換至 xAI 官方付費的 Console API,模型輸出又立刻恢復到 61 分的高水準。

GitHub 專案 Issues 記錄了多起具體測試案例:

1. Issue #916:Build 渠道基礎邏輯出錯與降階警告#

Issue #916 中,開發者使用 466 個帳號進行測試,發現 Build 渠道的 grok-4.6 在回答「9.11 和 9.9 哪個大」時,會間歇性回答成錯誤的 9.11,甚至直接超時。

同時,響應頭中頻繁出現 X-Grok2api-Compatibility-Warnings: reasoning_encrypted_content_downgraded 降階警告;而換到 Console 渠道的 grok-4.5 連續測試 10 次則全部正確且穩定。

grok2api GitHub Issue 916 截圖

來源:grok2api Issue #916: Build 渠道 grok-4.6 经 grok2api 调用时间歇性答错简单问题

2. Issue #839:不返回推理內容的特徵與「畫鵜鶘」壓力測試#

Issue #839 中,社群指出 Build 渠道的顯著降智特徵是「開啟思考但不返回推理內容」,並提出可透過代理重置與住宅 IP 輪換來改善。討論中也提到了社群常用來檢驗代碼物理邏輯的極限測試題目——「SVG 繪製鵜鶘騎自行車 2D 動畫」。

grok2api GitHub Issue 839 截圖

來源:grok2api Issue #839: 对于 Build/grok-4.5 开启思考但是不返回推理内容强制中断并重试请求

3. IP 降智現象與分析假說#

對於此現象,我們需要客觀區分「已觀察事實」與「推測假說」:

  • 已觀察到的事實
    1. Build 渠道在特定機房 IP 調用下,輸出質量顯著劣質化,基礎常識出錯率上升。
    2. 響應標頭出現 reasoning_encrypted_content_downgraded 等顯式降階警告。
    3. 官方付費 Console API 在相同測試集下保持穩定,未復現該異常。
  • 合理推測與工作假說
    • xAI 在 Cloudflare 防火牆或 API Gateway 端,針對數據中心 ASN、非瀏覽器環境與高頻調用啟用了動態風控,可能觸發了靜默分流機制,將請求導向較低算力資源的集群或輕量量化模型池。
  • 尚未證實的部分
    • xAI 後端的具體權重調度算法、是否經過模型裁剪或量化降階,屬於未公開的內部黑盒架構,仍有待官方進一步說明。

工程建議:若使用 grok2api,建議搭配乾淨住宅代理並控制請求頻率;若為關鍵業務與代碼重構,建議保留官方 Console 通道以確保輸出質量。


三、 DeepSeek V4 Pro 的評測爭議與定價落差#

過去以性價比引領開源浪潮的 DeepSeek,在本次發布的 V4 系列中引發了社群的廣泛質疑。

1. 評測 Harness 爭議#

在發布初期,官方宣傳材料中標榜 V4 Pro 在多項基準中比肩頂級旗艦。然而在第三方獨立復現時發現:

  • 官方測試疑似採用了特製的評測腳手架(Evaluation Harness),包含特定 Prompt 前綴與針對性取樣。
  • 當放入標準化的 Terminal-Bench v2.1、SciCode 與 GDPval-AA 測試集時,V4 Pro 在多輪長上下文狀態下的錯誤率明顯上升,最終在 Artificial Analysis 僅獲得 53 分。

2. 邊際提升與定價倒掛#

  • DSV4 Flash:綜合得分約 52 分,調用成本低廉。
  • DSV4 Pro (0813):綜合得分 53 分,相比 Flash 僅高出 1 分。
  • DSV4 Pro 的定價相比 Flash 翻了數倍,且傳出後續將調漲 API 價格的消息。在實際任務中,多付出數倍成本卻只能換來邊際效應極低的提升,導致 V4 Pro 在性價比維度失去競爭力。

四、 Google Gemini 3.7 Flash 的實際表現#

在 2026 年上半年,Gemini 3.5 與 3.6 Flash 因為上下文幻覺與代碼結構遺漏,常被開發者視為僅能用於基礎摘要的輔助工具。

但新推出的 Gemini 3.7 Flash (High) 展現出截然不同的水準:

  • 56 分的綜合智能:超越 DeepSeek V4 Pro(53 分)與 GPT-5.6 Luna(52 分),在邏輯推理與結構化代碼生成上有顯著提升。
  • 推論速度與吞吐:實測輸出速度超過 120 tokens/sec,首字延遲(TTFT)低於 200ms。
  • 超長上下文與定價優勢:延續了 1,000,000+ Token 上下文窗口,搭配低廉的定價(輸入約 $0.08 / 1M Tokens)與充足的官方免費額度,非常適合作為日常 Agent Coding 循環的高頻主力引擎。

五、 實測壓測:六大模型「鵜鶘騎自行車 SVG 動畫」橫向對比#

為了檢驗各模型在幾何座標約束、空間物理理解與複雜代碼生成上的真實表現,我們使用社群經典測試題目進行了標準化壓測:

提示詞:給我 HTML,內容是 SVG 繪製一個鵜鶘騎自行車的 2D 動畫。
檔案名稱:你的模型+XXX+.html

測試環境說明:本次測試屬於「模型 + Harness / 工具鏈 + 渠道」的實戰綜合考察。其中 GPT-5.6 Sol 運行於 Codex 深度推理體系,其餘模型運行於 DeepSeek Harness 測試環境中,各模型之步驟、思考檔位與上下文快取記錄於各項指標中。

以下依照測試順序,展示六個模型與檔位的實際生成結果:


1. GPT 5.6 Sol (xhigh / Codex 體系)#

  • 耗時:15 分 09 秒
  • 實測表現:腳部有正常旋轉轉動,自行車與鵜鶘的空間結構完整,動畫無 Bug。展現出頂級模型在深度 Reasoning 檔位下優秀的空間物理理解力。

GPT 5.6 Sol 鵜鶘騎自行車實測截圖


2. DeepSeek V4 Pro (MAX 思考檔位 / DeepSeek Harness)#

  • 指標數據:1 輪 · 2 步 | LLM 7m43s · 工具調用 0s | 首 Token 平均 1.9s · 75 tok/s | 快取命中 48% | 輸入 50.2K tok · 輸出 34.4K tok | 總耗時 7 分 42 秒
  • 實測表現:腳部正常轉動,幾何構造正確無 Bug。在 Max 思考檔位下表現扎實,但耗時與 Token 消耗相比 Flash 版本大幅增加。

DeepSeek V4 Pro 鵜鶘騎自行車實測截圖


3. Grok 4.6 high (Build 渠道 / DeepSeek Harness)#

  • 指標數據:1 輪 · 2 步 | LLM 57.4s · 工具調用 0s | 首 Token 平均 28.2s · 7020 tok/s | 快取命中 45% | 輸入 17.4K tok · 輸出 7.1K tok
  • 實測表現:全是 Bug。生成的 SVG 幾何嚴重錯位,腳部與踏板完全脫節,印證了 Build 渠道遭 xAI 靜默降階分流的現象。

Grok 4.6 high Build 鵜鶘騎自行車實測截圖


4. Grok 4.5 high (Console 渠道 / DeepSeek Harness)#

  • 指標數據:1 輪 · 2 步 | LLM 1m47s · 工具調用 0s | 首 Token 平均 3.3s · 83 tok/s | 快取命中 34% | 輸入 24.6K tok · 輸出 8.4K tok
  • 實測表現:腳沒有旋轉轉動,僅呈現前後擺動,且與自行車踏板完全對不上。物理聯動未達到預期。

Grok 4.5 high Console 鵜鶘騎自行車實測截圖


5. Gemini 3.7 Flash high (DeepSeek Harness)#

  • 指標數據:1 輪 · 2 步 | LLM 45.7s · 工具調用 0s | 首 Token 平均 21.7s · 5569 tok/s | 快取命中 0% | 輸入 28.9K tok · 輸出 13.1K tok
  • 實測表現:靜態繪製精緻度與色彩表現全場最佳,但存在動畫邏輯 Bug:腳部完全沒有擺動,輪胎直接跑出畫面外。屬於「美工極佳但在高難度單一幾何代碼上物理閉環失敗」的典型案例。

Gemini 3.7 Flash high 鵜鶘騎自行車實測截圖


6. DeepSeek V4 Flash Max (DeepSeek Harness)#

  • 指標數據:1 輪 · 5 步 | LLM 6m14s · 工具調用 0.1s | 首 Token 平均 0.8s · 119 tok/s | 快取命中 92% | 輸入 113K tok · 輸出 44.1K tok
  • 實測表現:腳部有正常旋轉轉動,畫面幾何正確無 Bug。生成品質完全比肩昂貴的 Pro 版本,展現出極高的性價比。

DeepSeek V4 Flash 鵜鶘騎自行車實測截圖


7. 【補測 · 滿血回歸】真 Grok 4.6 high(官方原生 Grok Build / 滿血 500K)#

  • 測試環境:官方原生 Grok Build CLI 深度推理環境(Grok 4.6 (high) · always-approve / 500K 上下文)
  • 指標數據
    • 深度思考耗時:1 分 39 秒(1m39s),對鳥類解剖學生理構造、自行車幾何機械傳動與 SVG 動畫視差進行全方位推導。
    • 代碼構建與自檢:深度思考 2.1 秒。
    • 總工作耗時:4 分 04 秒(Worked for 4m4s)| 上下文消耗:55k / 500k
  • 實測表現(降智前後震撼對比)
    • 降智前(grok2api 機房 IP 靜默降階版):僅用 57 秒草草敷衍,生成的幾何嚴重錯位、踏板與腿部完全脫節、全身 Bug,完全是遭遇風控分流後的假 4.6。
    • 降智後 / 真滿血(真 Grok 4.6 high):完成度直接封神!
      • 生物解剖學細節:完整側身大喉囊、長喙、頭頂微翹的小羽冠,喉囊裡甚至細膩地畫了一條小魚在探頭!
      • 物理機械閉環:一隻翅膀緊抓車把,另一隻翅膀自然扇動維持空中平衡;車輪、曲柄、腳蹼嚴格同相位旋轉,身體隨踏板踩踏節奏自然上下起伏。
      • 場景動態深度:背景海濱公路、層次分明的海浪、棕櫚樹與沙丘,滾動的車道線與海浪形成極具層次感的多層視差循環滾動動畫。

真 Grok 4.6 官方 Grok Build 終端執行截圖

真 Grok 4.6 滿血鵜鶘騎自行車 SVG 動畫瀏覽器渲染截圖


鵜鶘壓測橫向對比總結#

模型與渠道總耗時 / 思考深度動畫正確性 (腳部旋轉/踏板)靜態繪製美感與細節實務定性
真 Grok 4.6 high (官方 Build)4分04秒 (思考 1m39s)完美同步旋轉 (曲柄/腳蹼/羽翼平衡)神級 (海濱公路/喉囊小魚/視差背景)滿血旗艦,空間幾何與美工全場登頂
GPT 5.6 Sol (xhigh)15分09秒完美正常轉動良好滿血旗艦,結構無 Bug
DeepSeek V4 Pro Max7分42秒 (75 tok/s)正常轉動良好成功通過,但成本偏高
DeepSeek V4 Flash Max6分14秒 (119 tok/s)正常轉動良好性價比首選,無 Bug
Gemini 3.7 Flash high45.7秒 (極速)輪胎出界 / 腳不動極佳視覺美感佳,動畫物理邏輯有 Bug
Grok 4.5 high (Console)1分47秒 (83 tok/s)僅前後擺動 / 對不上普通物理聯動未閉環
Grok 4.6 high (Build 降智版)57.4秒全是 Bug / 嚴重錯位遭遇 IP 降智分流 (假 4.6)

六、 2026 年 8 月主流模型性價比天梯#

綜合考量廣泛日常開發基準(如 Terminal-Bench、SciCode)、Token 成本、推論延遲、空間幾何能力與風控穩定性,當前性價比排序為:

真 Grok 4.6 (官方 Build / 滿血)GPT-5.6 Sol>Gemini 3.7 Flash>DeepSeek V4 Flash>DeepSeek V4 Pro\text{真 Grok 4.6 (官方 Build / 滿血)} \approx \text{GPT-5.6 Sol} > \text{Gemini 3.7 Flash} > \text{DeepSeek V4 Flash} > \text{DeepSeek V4 Pro}

說明

  1. 真 Grok 4.6 (官方 Build 滿血版) 展現出頂級大模型的絕對實力,在極限空間幾何、生物解剖細節與動態閉環上與 GPT-5.6 Sol 並列第一梯隊;但必須警惕自建 grok2api 機房 IP 帶來的「靜默降階」陷阱。
  2. Gemini 3.7 Flash 雖然在單一極限 SVG 動畫生成上出現物理閉環 Bug,但憑藉 56 分的綜合基準分數、超高推論速度(120+ tok/s)與極低成本(輸入約 $0.08 / 1M),依然是目前全天候高頻 Agent 開發循環的首選。

主流模型綜合指標全景表#

排名模型名稱AA 智能分數 (2026.08)推論速度調用成本 (輸入 / 1M)穩定性與降智風險實務定位
1真 Grok 4.6 (官方 Build)61 分高速 (深度思考 1m39s)官方 Build 專享低 (官方原生滿血)旗艦代碼與空間幾何頂峰
2Gemini 3.7 Flash56 分極速 (120+ t/s)約 $0.08 (官方高額度)極低 (官方高額度)日常高頻主力首選
3Grok 4.6 (Console)61 分高速 (85+ t/s)官方標準定價低 (官方 Key 滿血)深度任務首選
4DeepSeek V4 Flash52 分極速 (110+ t/s)約 $0.15低 (官方穩定)表現中規中矩,性價比優秀
5Grok 4.6 / 4.5 (grok2api)40~61 分 (視 IP)中等 (受限於代理)極低 (自建中轉)高 (IP 降智與風控嚴重)適合低成本實驗,需防降智
6DeepSeek V4 Pro (0813)53 分中速 (45+ t/s)偏高 (即將調漲)高 (性價比倒掛 / 爭議)較 Flash 僅高 1 分,不推薦
7Claude Opus 5 (Max)63 分中慢速 (30+ t/s)約 $15.00低 (品質封頂)頂尖架構標竿,高預算專屬

七、 總結與選型建議#

大模型競爭已經不再只是單純比拼宣傳參數,實測智能、推論延遲、API 穩定度與定價策略共同決定了一個模型在真實工程場景中的價值。

  • 高難度架構設計與極限空間幾何:首選 官方真 Grok 4.6 (Build)GPT 5.6 SolClaude Opus 5。真 4.6 在鵜鶘騎車測試中展現的解剖學細節與物理閉環堪稱神作。
  • 日常 Agent Coding 與腳本開發:首選 Gemini 3.7 FlashDeepSeek V4 Flash。52~56 分的智能足以勝任絕大部分日常編程,速度快且成本極低。
  • 自建轉發服務(grok2api)防坑指南:若使用自建中轉,必須搭配乾淨住宅代理與調用間隔控制,否則一旦觸發 xAI 靜默分流,頂級 4.6 將瞬間退化為 57 秒的「殘缺降智版」。
  • 輕量問答與摘要:優先選擇 DeepSeek V4 Flash,避免花費高額溢價在提升微弱的 DSV4 Pro 上。

參考資料與延伸連結#

[8/20 更新] 實測!6 個模型跑相同 Prompt:誰是野狗誰是豆包?是小男梁還是梁太祖?GPT、Gemini、Grok、Deepseek批鬥大會。
作者
Typelin
發布於
2026-08-14
許可協議
CC BY-NC-SA 4.0

評論功能尚未開放