阿里巴巴推2.4兆參數AI模型 DeepSeek新品成本比Claude低逾百倍
記者彭夢竺/編譯
中國AI模型競爭再度升溫。阿里巴巴(Alibaba)4日發布歷來規模最大、能力最強的AI模型Qwen3.8-Max,參數量達2.4兆,發布後迅速登上文字與視覺模型排行榜前段班,帶動阿里巴巴香港股價一度大漲7%。同時,DeepSeek最新推出的V4-Flash則主打超低使用成本,研究機構估算,其平均測試成本僅約0.03美元,遠低於Anthropic的Claude Fable 5。
兩款模型分別從效能規模與價格切入,也凸顯中國AI業者正持續押注開放權重模型,希望以能力足夠、價格較低且可供開發者自行部署的產品,擴大全球市場影響力。

Qwen3.8-Max參數量達2.4兆
Qwen3.8-Max擁有2.4兆個參數,接近中國競爭對手月之暗面(Moonshot AI)上月推出的Kimi K3,後者參數量達2.8兆。
參數是模型從資料中學習的數值設定,可協助AI辨識模式、產生答案及執行任務。雖然參數數量較高不一定代表模型表現更好,但仍是衡量AI模型規模、運算能力與訓練資料量的重要指標之一。
Qwen3.8-Max在群眾評測平台Arena.AI公開後,迅速成為文字模型排行榜中排名最高的中國模型,但整體表現仍落後Claude Fable 5及Anthropic旗下3款Opus系列模型。在圖像與視覺資料分析排行榜中,Qwen3.8-Max則排名全球第2,僅落後Claude Fable 5的其中一款版本。
可一次處理100萬個Token
Qwen3.8-Max與Kimi K3均支援文字、圖片及影片等多模態內容,單次最多可處理100萬個Token。
Token是AI模型處理資料的基本單位,通常是一個單字、部分單字或短句。可處理的Token數量越高,代表模型能一次讀取更大量內容,例如長篇法律文件、大型程式碼資料庫,或數百頁報告。
阿里巴巴表示,Qwen3.8-Max預計下週正式推出,並曾在16天內完成一項軟體工程專案。
僅啟動950億參數降低成本
Qwen3.8-Max採用混合專家模型(Mixture of Experts,MoE)架構,將不同工作分配給模型內部的專門模組處理,不需要每次執行任務都啟動全部2.4兆個參數。模型每次實際運作時僅使用約950億個參數,有助於降低運算成本及回應延遲,同時保留大型模型處理複雜任務的能力。
研究機構Omdia首席分析師Lian Jye Su表示,許多企業工作流程並不需要產業中能力最強的AI模型,而是需要表現足夠、價格合理、運作透明且容易取得的產品,開放權重模型正好能滿足這類需求。
DeepSeek平均測試成本僅0.03美元
除了阿里巴巴追求模型規模,DeepSeek則透過價格搶攻市場。DeepSeek 1日發布V4-Flash,根據研究機構Artificial Analysis測試,這款模型是目前全球知名AI模型中,運行成本最低的產品。
V4-Flash每100萬個輸入Token收費0.14美元,每100萬個輸出Token收費0.28美元。
Artificial Analysis估算,V4-Flash完成一次基準測試的平均成本僅約0.03美元,相較之下,Kimi K3約為0.86美元、OpenAI的GPT-5.6 Sol約為1.86美元,Claude Fable 5則達3.15美元。
依此計算,Claude Fable 5的平均測試成本約為V4-Flash的105倍。
低價不代表整體成本一定低
Artificial Analysis指出,單看每100萬個Token的價格,未必能完整反映模型的實際使用成本。部分模型雖然單價較低,但若需要更多步驟、產生更多內容或反覆運算,最終完成任務的總成本仍可能偏高。因此,將模型完成同一項測試所需的平均成本納入比較,更能反映產品的實際性價比。
DeepSeek在2025年初便因R1及V3模型受到全球市場關注,不僅引發科技股賣壓,也讓投資人重新檢視美國科技公司投入鉅額資金發展AI的必要性。
隨著阿里巴巴持續擴大模型規模、DeepSeek進一步壓低使用成本,中國AI業者正從效能、價格與開放程度多面向競爭,也讓全球AI市場的價格戰更加激烈。
資料來源:路透社
![]()





