從 30 美元跌到 0.1 美元:「全面碾壓」之後,先結帳的是 API 牌價
Google 於 10 月 1 日發表 Gemini 4 Argon,基準成績被指全面領先 GPT 6,本文以兩年間前沿模型 API 輸入牌價下降約三百倍的歷史為座標,拆解領先分數的折舊速度、牌價的傳導路徑與資本支出的回收位置。
2023 年 3 月,OpenAI 給 GPT-4 API 開出的牌價是每百萬 tokens 輸入 30 美元、輸出 60 美元。2024 年 12 月,Google 把 Gemini 2.0 Flash 的輸入單價定在每百萬 tokens 0.1 美元。不到兩年,前沿模型的輸入牌價下降約三百倍,而這段期間每一場發表會的新聞稿寫的都是同一件事:新一代模型全面超越上一代。
10 月 1 日,Google 發表 Gemini 4 Argon。知乎相關提問的描述很直白,指標上全面碾壓 GPT 6。這個句式過去三年反覆出現,市場的反應路徑也大致固定:計分板上的領先先換成討論熱度,幾週之後換成牌價調整。評價這場發表,不妨就從領先分數的折舊速度看起。
領先分數的保鮮期,以週計
MMLU 於 2020 年發表時,GPT-3 的成績是 43.9%;2023 年 3 月 GPT-4 把這個數字拉到 86.4%,兩年多推進 42.5 個百分點,人類受測基準 89.8% 就貼在頭頂。之後曲線壓平,2024 年以降的前沿模型普遍落在 85% 到 92% 之間,這份考卷失去鑑別度,產業換考題。GPQA Diamond 上,2023 年的前沿模型還在四成上下,2025 年已逾七成;SWE-bench Verified 從 2024 年年中的三成水位,一年內翻過七成。考卷更換的頻率還在縮短,與我們先前分析AI 物理紀錄熱搜背後的計分板與成本帳時看到的基準壽命壓縮是同一件事:當每個月都有新模型刷分,任何單一基準的有效期限都以月計,部分題目流入訓練資料的污染疑慮又讓靜態基準再折一次價。
榜首輪替的速度更直觀。LMArena(原 Chatbot Arena)上,GPT-4 從 2023 年 3 月起佔據榜首約一年;2024 年 8 月之後,Gemini 實驗版、GPT-4o、Claude 新版輪流登上第一,2025 年 3 月 Gemini 2.5 Pro 登頂時,市場已經習慣榜首以週為單位易主。在這種節奏裡,「全面碾壓」的保鮮期很短,企業採購端真正拿來比較的欄位,早已從榜單名次移到單位成本與服務可用性。
領先之後是降價,這三年的軌跡一致
把歷次發表會對應的牌價排成一列,模式很清楚。GPT-4 在 2023 年 3 月開出輸入 30 美元的牌價;同年 11 月 GPT-4 Turbo 降到 10 美元;2024 年 5 月 GPT-4o 以 5 美元接棒,三個月後再砍半至 2.5 美元;2024 年 12 月 Gemini 2.0 Flash 把輸入單價壓到 0.1 美元。每一代的新模型都比前一代強,牌價卻一路向下,能力領先兌換到的東西,過去三年多數時候是發動下一輪降價的本錢。
2025 年初的 DeepSeek 事件把這套邏輯推到極端。DeepSeek 在 V3 技術報告中披露訓練成本:278.8 萬個 H800 GPU 時,按每 GPU 時 2 美元換算約 557.6 萬美元;隨後 R1 的輸出牌價定為每百萬 tokens 2.19 美元,當時 OpenAI o1 的同口徑牌價是 60 美元,差距約 27 倍。牌價體系被重寫之後,降價從行銷手段變成結構性動作:推理端的稀疏化與規模攤提壓低邊際成本,領先者最有力的下一步是用價格搶用量,同時拉長對手的回收週期。
Google 的帳本最能說明這條路徑的回報結構。2025 年 5 月的 I/O 上,Google 公布每月處理 tokens 達 480 兆,一年前這個數字是 9.7 兆,成長約 50 倍。近免費的牌價是採購誘因,用量膨脹最終記在 Google Cloud 的營收與母公司財報的折舊行上。Argon 這場發表無論領先幅度多大,商業兌現的位置都在雲端帳單,而雲端帳單的前提是算力存量。
發表會的背面:四張資本支出表
支撐這種發表節奏的,是四張已經寫好的資本支出表。Alphabet 2024 年資本支出 525 億美元,2025 年指引從年初的 750 億美元一路上調至約 850 億美元;微軟 2025 財年約 800 億美元;Meta 指引 660 億至 720 億美元;亞馬遜全年約 1,000 億美元。Stargate 計畫於 2025 年 1 月宣布四年 5,000 億美元的建設規模。Sam Altman 在 2023 年受訪時表示,GPT-4 單次訓練成本超過 1 億美元,之後每一代的訓練帳單只增不減。
支出的回收端高度集中在雲端合約。路透社取得的 Anthropic 保密版 IPO 申報文件顯示,其 2025 年 47% 的營收經亞馬遜與 Google 的雲端市集完成,長期算力採購承諾突破 4,170 億美元,這份Anthropic 招股書裡的循環資本結構顯示,前沿競賽的出資者、算力供應方與通路正在同一批主體之間循環。這也是評價 Gemini 4 Argon 時容易漏掉的背景:發表會上比的對象是模型,財報上比的對象是算力存量與雲端通路,後者的差距遠比榜單名次穩定。
誰受惠,誰承壓
應用層是這輪競賽最穩定的受惠方。輸入單價兩年下降約三百倍,等於推理預算的購買力同步膨脹,開發商的單位毛利直接改善;對以 tokens 計費的推理基礎設施與雲端市集而言,價跌量增的淨效果目前為正,TPU 與 GPU 的需求並未因單價下滑而收縮。
承壓最重的是第二梯隊模型公司。「全面碾壓」的敘事每出現一次,採購方對非頭部模型的耐心就少一分;當頭部 API 的牌價壓到接近二線模型的損益兩平線,後者的空間收窄到垂直場景與私有部署。OpenAI 的位置相對特殊,據 The Information 報導,其營收從 2023 年約 16 億美元增至 2024 年約 37 億美元,但要同時在牌價與算力兩端跟進 Google 的節奏,利潤表的壓力大於任何一張計分板。
兩種情境
情境一,Argon 的領先按歷史路徑兌換成牌價下調與用量膨脹,計分板繼續以週為單位輪替,發表會的價值最終體現在 Google Cloud 的營收成長率上。情境二,GPT 6 的後續版本在代理型任務基準(SWE-bench 這類)奪回領先,企業合約端重新比價,屆時雙方差距會以合約年限與承諾用量計價。兩條路徑指向同一個結論:榜單名次的折舊以週計,能穿越發表週期的定價權,位置始終在算力與通路兩端,沒有因為任何一次「全面碾壓」移動過。