124B 容量、5.1B 啟用:Ling-3.0 開源六個檢查點,把訓練半程放上貨架
螞蟻百靈開源 Ling-3.0 tiny 與 flash 的 Base 版及六個訓練檢查點,本文從 MoE 啟用配比、WSM 離線合併的成本邏輯與開源範圍的位移,拆解受惠方與承壓方。
總參數 124B,每次前向傳播啟用 5.1B,比例約 4%。Ling-3.0-flash-base 的規格表把模型容量與單次推理的計算量拆成兩個獨立數字,這組配比來自 MoE 的稀疏啟用設計。2026 年 8 月下旬,螞蟻百靈在陸續開源 Ling-3.0-tiny 與 flash 之後,再將兩者的 Base 版正式上架,權重放在 Hugging Face 與 ModelScope 的 inclusionAI 帳號下。這次開放的範圍超出最終權重:預訓練與中期訓練的中途檢查點一併釋出,兩個模型合計六個。
回看開源模型這三年的釋出節奏,開放的邊界一直在往前推。2023 年 Llama 2 開放權重,確立成品模型的共享格式;2025 年 1 月 DeepSeek-R1 以 MIT 授權釋出,一週後輝達單日下跌約 17%,市值一天蒸發近 5,900 億美元,市場首次為開源模型的能力直接定價。多數發布者到最終權重為止,訓練過程的中途權重通常留在實驗室的儲存叢集裡。Ling-3.0 這次把邊界推到了製程本身。
兩個模型,一本配比帳
tiny-base 總參數 7.9B、啟用 1.3B,啟用佔比約 16%。官方資料稱其以約前代 50% 的總參數量,在多數評測項目取得更高分,程式能力在同規模模型中具競爭力。flash-base 總參數 124B、啟用 5.1B,佔比約 4%,官方評測顯示其整體表現優於總參數量約 2 至 3 倍的 base model,程式、複雜推理與長上下文是相對突出的方向。
MoE 架構的帳本把兩種成本分開記:訓練支出大致隨總參數與資料規模走,推理成本主要隨啟用參數走。flash 等於用 5B 級的單次推理開銷,換取 124B 級的知識容量;官方對照組是總參數 250B 至 370B 的模型,兩邊每 token 的計算量不在同一量級。這與我們先前拆解的GPT-5.6 Sol Ultrafast 每秒 750 詞元的推論邊際共用同一條算式,token 價格的底線由啟用參數決定。
六個檢查點站的位置
六個檢查點按訓練進度排成三段。預訓練檢查點已完成大規模預訓練,尚未進行中期訓練、WSM 合併與後訓練;中期訓練檢查點完成了中期訓練,等待合併;WSM 合併檢查點完成合併,停在後訓練之前。從儲存庫命名看,「-30T」版本對應預訓練階段的快照,「-midtrain」對應中期訓練,不帶後綴者為合併後的基礎權重。
對照市場慣例,Llama 與 Qwen 系列通常只開放 base 與 instruct 兩個版本,中間過程不對外。中途權重的稀缺性落在研究端:資料課程怎麼安排、專家路由何時收斂、中期訓練抽換資料對各項能力的影響,這些問題只有拿到中途權重才能做實證,論文裡的損失曲線替代不了權重本身。官方也把適用範圍寫得明確:持續預訓練、領域監督微調、偏好優化、強化學習後訓練、蒸餾,以及長上下文與 MoE 系統研究。
WSM:把學習率衰減搬到離線
WSM 指 Warmup-Stable and Merge。做法是把傳統的學習率衰減從訓練路徑上拿掉,預訓練與中期訓練全程使用恆定學習率,結束後再將多個檢查點加權合併,在離線階段合成出原本需要衰減程序才能達到的最終品質。
成本結構的改變有兩層。第一層在實驗開銷:過去要比較兩條衰減曲線,得各自安排一段訓練;現在檢查點存下來,合併在離線進行,一次訓練可以衍生多條「衰減曲線」的成品,官方稱之為訓練後離線探索。第二層在擴展性:衰減過的模型學習率已壓到底,接新資料前要先把學習率拉回,資料分布一變容易受損;恆定學習率的 Base 沒有這道收尾,持續預訓練、動態擴充資料、再合併的路徑是通的。對有意接手訓練的團隊,這個設計省下的未必是算力總量,而是反覆試錯的訓練輪次。
預訓練本身的資本門檻並未因此下降。這與我們先前分析的DeepSeek v4Pro 公告曇花一現背後的資本擠壓落在同一條曲線上:頭部模型的訓練支出持續墊高,開源成為把已投入的固定成本換取生態影響力的標準動作。螞蟻的場景重心在金融與保險,開放過程檢查點吸引的研究流量,價值高於成品權重本身帶來的下載量。
誰拿到素材,誰的報價被壓
研究機構是第一層受益者。中途權重過去極少流出,資料課程與 MoE 路由的實證研究長期缺乏素材,六個檢查點提供了現成的對照組。握有領域語料的企業是第二層:金融、醫療、法律這類長文件產業,拿到一個適合持續預訓練的底座,接入成本低於從已衰減的權重重啟學習率。
承壓方同樣具體。中段稠密模型的預訓練團隊首當其衝:7.9B 總參數打贏 2 至 3 倍大的 base,意味著 10B 至 30B 級稠密預訓練的投資回收期被壓縮,同一筆預算在開源底座上做後訓練的報酬更高。銷售開源模型微調與部署服務的廠商,面對底座品質上升與製程知識擴散,兩頭壓縮服務溢價。閉源的中段 API 也受牽連:當開源 base 在程式與推理項目追上兩倍大的模型,按 token 計價的中段報價帶最先鬆動。
責任的移轉則寫在官方說明裡。Base 模型未做指令對齊,生產使用前應完成面向具體任務的後訓練、評估與驗證,對齊與安全評測這幾個環節的成本由取用者承擔,這筆支出在談論免費權重時常被略過。
後續觀察節點
後續追蹤可以落在幾個可驗證的節點。第三方以這批中途檢查點發表的複現與消融研究何時出現,數量決定這次開放的研究影響力上限。持續預訓練的實際成本節省幅度,WSM 省下的訓練輪次換算成 GPU 時數後是否足夠顯著。中段 API 在程式與推理兩個強項上的價格反應。以及同業是否跟進開放中途檢查點,若這成為新的釋出標配,預訓練成果的商品化壓力會再加深一層。
價值分布的推演相對清晰。成品權重持續降價,後訓練資料與評測環節的專業報酬相對上升;固定成本往算力與資料端集中,開放過程則把研究社羣的注意力換成生態籌碼。六個檢查點本身定價為零,被擠壓的是其他環節的收費能力:中段模型的自有預訓練、通用微調服務,以及按 token 計價的中段 API。