跳至主要內容
Agchub Agchub

遲到二十四個月的開口:DeepSeek 語音對話的四種音色與三張帳單

DeepSeek於2026年9月12日灰度測試語音對話並開放貝殼、白浪、海星、暗潮四種朗讀音色,本文從級聯與端到端的延遲差距、音訊token相對文字的40倍價差,到免費無廣告模式的成本紀律,拆解這項遲到二十四個月功能的受惠與承壓方。

/ 編輯部 #人工智慧#語音介面#成本結構#市場趨勢
遲到二十四個月的開口:DeepSeek 語音對話的四種音色與三張帳單

2024年9月,OpenAI 向 ChatGPT 付費訂閱者全面開放 Advanced Voice,官方口徑的平均回應延遲為320毫秒。整整兩年後的2026年9月12日,DeepSeek 才開始在自家 App 內分批灰度測試語音對話:入口是右上角一個小喇叭按鈕,設置頁新增「朗讀音色」欄位,可選音色四種。二十四個月的時間差,答案寫在成本結構裡:所有對話介面當中,語音的單位成本最高,對推理算力的消耗也最直接。

一支刪到只剩文字的 App,撐了二十個月

DeepSeek App 於2025年1月隨 R1 模型的擴散走紅,當月即登頂多個市場的 App Store 免費榜,QuestMobile 量得的月活峯值在2025年2月達到約1.9億。與同期競品相比,這支 App 的功能清單異常克制:沒有會員制與廣告版位,語音對話也遲遲未上線。豆包在2025年1月底上線端到端即時語音通話,之後數個月成為中國首款對外確認月活破億的 AI 原生 App;元寶、Kimi、訊飛星火先後把語音列為標配。ChatGPT 的規模更大,2025年10月開發者大會公布的每週活躍使用者口徑達八億。功能最少的 DeepSeek 靠模型口碑維持留存,這在免費模式下成立的前提只有一個:把每一次對話的邊際成本壓到最低。

這次開口提供的四種音色延續海洋命名:貝殼標榜百變活潑,白浪明朗堅定,海星俏皮甜美,暗潮低沉渾厚,聲線加人設描述的做法接近豆包與 ChatGPT 的音色貨架。設置欄位名稱寫的是「朗讀音色」,而非即時對話或語音助理;從命名看,第一階段形態比較接近語音輸入、文字推理、語音播報的級聯組合,與 GPT-4o 那種原生即時情感對話之間,還隔著一個架構世代。

圖卡列出DeepSeek語音對話灰度測試提供貝殼、白浪、海星、暗潮四種朗讀音色,以及活潑、堅定、甜美、低沉四種聲線定位

三個計費環節,兩輪語音週期

語音介面的商業史走過兩輪。第一輪由 Siri 在2011年隨 iPhone 4S 開場,Echo 於2014年把語音帶進客廳,亞馬遜2019年對外稱搭載 Alexa 的裝置累計銷量已破一億臺;中國市場的智慧音箱出貨量在2019至2020年間攀上高峯後連年下滑。這一輪建立在小命令、單輪回應之上,始終沒有找到穩定的獲利公式。第二輪由大模型重啟,計時起點正是2024年9月的 Advanced Voice,DeepSeek 是主要玩家中最晚開口的一個。

原因攤開在計費結構上。級聯式語音對話要串三個模型:語音辨識把聲音轉成文字,語言模型生成回覆,語音合成再把文字轉成聲音。三個環節各自計費,延遲逐級疊加。OpenAI 選擇重做端到端原生音訊模型,把平均延遲壓到320毫秒,代價直接寫在價目表上:2024年8月公開的 gpt-4o 音訊 API 定價,音訊輸入每百萬 token 收100美元,音訊輸出每百萬 token 收200美元;同模型的文字輸入為2.5美元,輸出10美元。聲音進門比文字貴40倍,出門貴20倍。OpenAI 把新能力逐欄寫進價目表的節奏,先前在ChatGPT Sites 逐欄覆蓋網站架設業的價目表的分析中已見過一次,音訊介面沿用同一套邏輯。

統計圖卡呈現GPT-4o音訊輸入價格為每百萬token 100美元,相當於文字輸入每百萬token 2.5美元的40倍,凸顯語音互動相對文字的成本落差

對一家免費且無廣告的 App 而言,這個倍數足以解釋二十個月的等待。文字對話的成本可以靠蒸餾、上下文快取與更小的模型版本往下壓,音訊的每一秒都黏著算力。分批灰度測試在此扮演成本閥門:先開放小比例使用者,量測單次通話的實際 GPU 佔用與中斷率,再決定放量節奏。環節本身的商品化程度也在變化,小米近期開源了工業級目標說話人語音辨識模型 Xiaomi-CocktailASR-1,語音辨識的取得成本持續下探,級聯方案的組裝總價比三年前便宜了一截,這是 DeepSeek 敢在此時開口的產業背景。

四種音色對上的市場座次

受惠方的名單不長。第一層是使用者,免費取得人格化音色搭配頂規推理模型的組合,目前市面上沒有第二份同等報價。第二層是 DeepSeek 自身的留存帳:豆包的先例顯示,語音通話對單次使用時長與回訪頻率有明顯槓桿,對一款靠口碑而非投放維持的 App,這是成本最低的留存工具。

承壓方的結構更值得攤開。豆包、元寶、Kimi 這類以語音體驗做差異化的助手 App,面對的是品牌與免費畫上等號的後進者,語音從特色回到基準配備;以語音技術起家的訊飛,主場迎來免費玩家;商業 ASR 與 TTS 授權商同時面對大廠自研與開源模型的兩面擠壓,報價空間收縮。最後一個承壓者是 DeepSeek 自己,免費模式下音訊推理的邊際成本高於文字,灰度測試本身就是這筆帳的風控工具。

圖卡列出DeepSeek語音對話上線後的受惠與承壓方:使用者與DeepSeek留存屬受惠端,同業助手App、語音技術授權商與DeepSeek自身推理成本屬承壓端

免費之後的下一步:三種情境

同一段時間,DeepSeek 在文字端打出另一手牌。V4.1 Flash 宣稱全面超越 V4 Pro、支援原生多模態視覺理解,API 最高降價60%;原定9月14日下線的 V4 Pro 服務宣布延續,計費方式不變。文字降價搶開發者,語音灰度試水溫,兩條線共用同一套成本紀律。

後續走向可以拆成三種情境。其一,朗讀式形態常態化,成本增量最小,與免費模式相容度最高,代價是體驗停留在單向播報。其二,升級端到端即時對話,體驗對齊 GPT-4o 與豆包,但單次對話算力倍增,全量免費開放的機率低,更可能以限時限額形式推進。其三,語音能力進入 API,按音訊 token 計價,把成本轉由開發者承擔;對照 OpenAI 每百萬 token 100美元的行情,這是唯一能把語音支出轉為收入的路徑。

四種音色全部取自海洋,呼應 DeepSeek 的深海命名體系。真正的變數在階梯選擇:從朗讀走到即時,每一階的邊際成本相差一個量級,而免費模式沒有外部買單者。灰度測試推進的速度與範圍,就是這本帳最直接的讀數。