AI工具

Google 推出 Gemini 3.7 Flash:編碼與 AI Agent 能力大躍進,價格僅 GPT-5.6 Terra 三分之一

Google 於 8 月 13 日發表 Gemini 3.7 Flash,距離上一版僅隔三週,定位為「歷來最聰明的工作馬模型」。在編碼與 AI Agent 評測中與 GPT-5.6 Terra 互有勝負,輸出速度為對手三倍,促銷價僅為 OpenAI 定價約三分之一。第三方測評綜合智慧指數僅落後 GPT-5.6 Terra 一分,但完成任務成本低 40%。分析認為價格已成為企業選用大模型的最重要基準。

Google 於美國時間 8 月 13 日發表 Gemini 3.7 Flash,距離上一版 3.6 Flash 推出僅相隔三週,官方將這款模型定位為「歷來最聰明的工作馬模型」(workhorse model),專注於**編碼能力與 AI Agent(AI 代理)**兩大應用場景,並以極具侵略性的促銷定價推向市場,輸入價格僅為 OpenAI 主力模型 GPT-5.6 Terra 的 37.5%。

編碼與 Agent 評測:與 GPT-5.6 Terra 互有勝負

根據 Google 官方公布的對照測試成績,Gemini 3.7 Flash 在編碼與 AI Agent 領域的表現亮眼。在衡量產品級程式碼生成能力的 FrontierCode 1.1 Main 評測中,得分從上一版的 34.4% 提升至 43.6%,超越 GPT-5.6 Terra 的 41.3%;在網頁開發測試 Code Arena 中,Elo 評分為 1588,同樣領先對手的 1523。

不過在更複雜的長程軟體工程測試 DeepSWE v1.1 中,Gemini 3.7 Flash 取得 65.3%(較 3.6 Flash 的 49.0% 大幅躍升),但仍略遜於 GPT-5.6 Terra 的 69.6%;終端機代理測試 Terminal-bench 2.1 則錄得 85.8%,對比對手的 87.4%。整體而言,Google 在短短三週內將模型編碼能力從 49% 拉升至 65%,迭代速度驚人。

第三方測試:綜合智慧僅差一分,速度快 40%

第三方評測機構 Artificial Analysis 在發布前的實測數據進一步印證了 Gemini 3.7 Flash 的競爭力。該模型在高推理模式下的綜合智慧指數(涵蓋代理、編碼、知識工作等多類任務的總和評分)獲得 56 分,較 3.6 Flash 提升 4 分,僅次於並列 57 分的 GPT-5.6 Terra 與 Meta Muse Spark 1.2。

速度是 Gemini 3.7 Flash 最突出的優勢。該機構指出,該模型每秒可輸出約 340 個 token,幾乎是 GPT-5.6 Terra 的三倍;換算成實際工作情境,完成測試中單一任務平均只需 1.7 分鐘,比 GPT-5.6 Terra 快 40%。以促銷價計算,每項任務成本約 0.4 美元,比 3.6 Flash 便宜 30%。

在兩項企業級代理測試中,這款平價模型甚至擊敗各家旗艦模型:模擬企業軟體環境的代理測試 AutomationBench-AA 以 62.7% 的成績居首,領先第二名 Kimi K3 的 52.7%;試算表與文件問答測試 AA-AnalystAgent 拿下 60%,超越 Anthropic 的 Claude Opus 5(53.8%)。

價格戰升級:Gemini 3.7 Flash 定價僅為 GPT-5.6 Terra 的三分之一

截至 2026 年 12 月 31 日,Gemini 3.7 Flash 的促銷價為每百萬 token 輸入 0.75 美元、輸出 3.75 美元。對比 OpenAI 於 7 月 30 日調降後的 GPT-5.6 Terra 定價(輸入 2 美元、輸出 12 美元),Gemini 3.7 Flash 的輸入價格僅為對手的 37.5%,輸出為 31.25%。2027 年 1 月 1 日起恢復標準定價(輸入 1.5 美元、輸出 7.5 美元)後,仍約為對手的 75% 與 62.5%。

Google 執行長皮蔡(Sundar Pichai)在 X 發文表示,Flash 系列是 Google 的「工作馬」,負責消化大量日常任務的主力模型:「提供高性能與絕佳價格,因此我們快速推出更新,將它們交到開發者手中。」這已是 Google 三個月內第三次更新主力 Flash 型號(從 3.5、3.6 到 3.7)。

業界觀點:價格已成為最重要基準測試

科技研究機構 Constellation Research 旗下 Constellation Insights 總編輯 Larry Dignan 在評論中直言,大型語言模型最有價值的基準測試正快速變成價格:「我們大可繼續比較其他基準測試,但誰在乎呢?Gemini 3.7 Flash 會夠好用。」他觀察到,token 成本已是各企業財報電話會議上反覆出現的關鍵字,沒有一家企業不在緊盯 AI 預算。

同篇文章中,Dignan 也引述 Palantir 執行長 Alex Karp 對當前前沿模型收費模式的觀點:「這套 token 收費模式對 AI 實驗室或許行得通,但對其他所有人都行不通。它正在打破企業預算,卻拿不出足以合理化開支的成果。」

市場動態:DeepSeek 反其道漲價,企業對高價模型需求有限

值得注意的是,就在 Google 降價的同一週,以低價聞名的 DeepSeek 反其道而行。《彭博》報導,DeepSeek 自 8 月 16 日起實施尖峰時段動態定價,最先進的 V4-Pro 模型尖峰時段輸出價格從每百萬 token 0.87 美元大幅調高至 3.96 美元,漲幅約 355%。DeepSeek 官方表示此舉是為了「更合理地分配資源」,且調漲後價格仍遠低於美國對手。

企業支出管理平台 Ramp 的 8 月報告則提供另一個值得關注的數據:在其 token 支出管理產品觀測到的企業客戶中,Anthropic 性能最強、也最貴的旗艦模型 Fable 5 上市一個月,僅占受觀測 Anthropic token 採購量的 6%,顯示企業為「更聰明」模型多付錢的意願有明確的上限。

結語

Gemini 3.7 Flash 的發布標誌著 Google 在 AI 模型市場的定價策略進入新階段——不再僅以效能競爭,而是以「足夠好」的效能加上更具吸引力的價格來爭取企業客戶。對於香港的企業開發者與科技團隊而言,這意味著在選擇底層模型時,除了考量編碼與 Agent 能力,價格效益比也將成為更重要的決策因素。同時,DeepSeek 的漲價與企業對高價模型需求的有限性,也反映出市場正在從「軍備競賽」走向「務實部署」的新階段。