跳至主要內容
Agchub Agchub

名字留在 Opus 5,權重走到 5.2:灰度路由裡的版本與成本帳

Claude Code 前端名稱未變、後端 slug 已指向 Opus 5.2,本文從灰度路由的版本策略、勤奮輸出的 token 成本歸屬,到內部報告指 Model 2 接管 85% 程式碼編寫的研發帳,拆解受惠與承壓方。

/ 編輯部 #人工智慧、成本結構、市場競爭
名字留在 Opus 5,權重走到 5.2:灰度路由裡的版本與成本帳

9月15日清晨,Claude Code 的使用者沒有等到任何公告,卻在 /status 查詢與封包擷取裡看到同一個字串:opus-5.2。前端型號仍標示 Opus 5,後端權重已經換代。5.1 從未公開存在,開發者據此推斷 Anthropic 跳過了這一版。前沿實驗室慣用的漸進開放在此上演:先讓一部分真實流量跑新權重,名稱與價目表都不動。

開發者的回報指向同一組變化。生成速度先脫離了 Opus 5 的慢節奏。輸出變得乾淨,鋪陳刪去後直接切進要害。最被反覆提及的差異在耐性:長任務不再中途喊停,也不再只交出框架要人自行補完,而是自動進入自我迭代的嚴酷循環(gauntlet loop),把程式碼修到任務收尾。有開發者在 X 上形容,這個版本像不需要催促的工作狂。

清單圖列出 Claude Opus 5.2 灰度測試中開發者回報的三項變化:生成速度加快、輸出直切要害、長任務自動迭代完成不中途喊停

一個提示詞當探針,權重差異現形

灰度名單如何確認?使用者找到的探針是一段提示詞:關閉聯網搜尋後詢問「重置哥 Tibo 是誰」。舊權重的訓練資料裡查無此人的細節,回答是一片空白;被路由到 5.2 的帳號則能辨識身分,甚至說明「重置哥」稱號的由來。開發者 jan_volad 對照兩側截圖後的結論很直接:同一個提示詞、關閉搜尋、答案完全不一致,兩邊跑的已經是不同權重。

這個探針把「模型更新」從形容詞拉回可驗證的事實。名稱不動、權重替換,對閒聊場景影響有限,對程式碼場景是另一回事,輸出的可重現性與行為穩定度都是企業採購時寫進合約的欄位。2024 年 OpenAI 使用者曾集體回報 GPT-4o 變懶,爭議延燒多日;同年 10 月 Anthropic 更新版 3.5 Sonnet 上線之初,也因命名不清引發混淆。無公告換權重,正向走是免費升級,反向走就是品質爭議,兩個方向共用同一個機制。

對照組並不遠。這與 DeepSeek 以灰度方式導入語音對話與四種音色的節奏相近,先小流量驗證成本與穩定度,再全面開放。差別在於 DeepSeek 的灰度掛在明確的新功能上,Opus 5.2 的灰度藏在既有型號名下,驗證項目除了能力,還有使用者對無感升級的接受度。

「勤奮」的計價結構

偷懶在代理編碼產品裡是折價因子。模型中途停下要求按「繼續」,或只交付骨架要人補完,直接拉低任務完成率,完成率則是這類產品最核心的效度指標。5.2 把停止條件往後挪,代價是單一任務的輸出 token 消耗上升:循環每多跑一輪,就多燒一輪按輸出欄位計價的推理成本。

這筆成本落在誰頭上,取決於付費模式。走 API 的客戶按 token 結帳,輸出單價歷來是輸入的數倍,勤奮模型把帳單結構往高單價欄位推。走訂閱的客戶付固定月費,Claude Code 目前階梯落在每月 20 美元至 200 美元之間,多出來的循環成本由 Anthropic 吸收,換取完成率與續訂率。同一項「不偷懶」,在兩種計價模式下是兩本帳。

生成速度的提升是反向力量。同樣的循環輪數,延遲壓縮後佔用的時間成本下降,部分抵銷 token 消耗的增幅。勤奮與提速一起上,這次升級在成本帳上才站得住;只勤奦不提速,訂閱制的邊際成本會先失控。

85%:內部報告裡的研發替代帳

灰度之外,另一份文件把焦點拉到研發費用結構。8 月中旬曝光的內部風險報告顯示,Anthropic 內部已廣泛使用代號 Model 2 的未發布模型,由它接手公司大部分程式碼編寫,文件寫的替代規模是研究團隊工作量的 85%。

統計圖呈現 Anthropic 內部風險報告所指,未發布的 Model 2 已接管 85% 研究團隊程式碼編寫工作的替代比例

85% 說的是任務層級替代,不等於裁員幅度。前沿實驗室的費用結構裡,算力與研究人力是兩條最大支出,把自家模型用進內部工程,等於把一部分邊際工程成本從薪資科目搬到推理科目,同時產出真實工作負載的反饋資料。每一行由 Model 2 生成的內部程式碼,同時是成本節省與訓練素材,內部自用策略在這裡走到財務上最完整的形態。

報告性質仍須標註。它是風險文件,未經審計,85% 是文件陳述的數字,外部無法覆核。文件同時把敘事推向 RSI(遞迴自我改進),這類表述的推銷成分高於可驗證成分,比較適合併入安全成本如何入帳的討論,與先前四款大模型自評滅絕風險引發的排序爭議屬同一類問題:模型對自身風險與能力的陳述,目前缺乏外部查核機制。

對 GPT-6 Astra 的三層方案

同一份報告給出三層方案,且可能疊加。第一層是 Fable 5.2 家族,最快的對外版本,對照本輪灰度,上市窗口落在 9 月底至 10 月底。第二層是 Model 2,內部模型,未發布、沒有對外價格。第三層細節未完整揭露,疊加的說法顯示 Anthropic 傾向內外兩線分開計價:對外賣 Fable 家族,對內用 Model 2 壓研發成本。

清單圖列出 Anthropic 應對 OpenAI GPT-6 Astra 的三層方案:Fable 5.2 家族最快九月底對外、未發布的內部模型 Model 2、細節未揭露且可能與前兩案疊加的第三層

跳過 5.1 的版本算術放在這個架構下有了著落。對外版本號是行銷節奏,內部迭代速度早已脫鉤;5.1 若曾存在,最有可能是內部版本,或評估後不值得佔用一個發布檔期。直接以 5.2 對外,等於把一段內部迭代壓縮成一個可對外敘事的跨度,灰度測試此刻的功能,是上市前以真實開發者工作負載進行的最後一輪驗證。

受惠與承壓的傳導

灰度名單內的訂閱者先受惠,同一張月費帳單換到新權重,等於折價嘗鮮。Anthropic 的受惠在資訊面,真實流量裡的長任務表現比任何內部評測都接近上市後的真相。代理編碼賽道整體也有機會受惠,完成率基準抬高後,客戶對按結果付費的接受度通常跟著上升。

承壓端有三處。OpenAI 的 GPT-6 Astra 時點被壓縮,對手灰度即將結束,錯開檔期的空間縮小。同類編碼代理工具面對移動中的基準,產品差距可能在一個季度內重算。API 大用量客戶的帳單結構改變,勤奦意味著單任務 token 消耗上升,若 5.2 正式版價格同步調整,成本轉嫁的談判會落在這批客戶身上。無公告換權重的做法本身也在累積信任成本,企業對固定版本端點的需求,會隨每一次無感變動上升。

結帳前的觀察項

後續追蹤落在可驗證的節點上:Fable 5.2 是否在 10 月底前全面上市;API 是否提供固定版本端點,讓新舊權重可並行選用;5.2 正式定價是否隨勤奦程度調整。三項都朝開放方向走,這輪灰度就是一次成本可控的上市預演;固定版本端點持續缺席,無公告換權重將從部署手法轉成定價爭議的引信。