阿里巴巴在日益升溫的中國 AI 軍備競賽中再開一槍,推出 Qwen3.8-Max,這款 2.4 兆引數的模型,該公司宣稱可與 OpenAI 和 Anthropic 的最強模型匹敵,甚至在某些方面勝出。這項發表於 2026 年 8 月 3 日對外公佈,距離 Moonshot AI 的 Kimi K3 席捲全球頭條僅數週之隔,也顯示中國實驗室已不再以明顯差距落後於美國同業。
這款新模型採用混合專家(Mixture-of-Experts)設計,每次請求僅啟動 950 億個引數,這是個巧妙的折衷方案,既能壓低推論成本,又能維持更大規模網路所帶來的效能。它可處理文字、圖片和影片,並支援最高 100 萬 token 的上下文視窗——足以在單一提示中容納整個程式碼庫或一整疊檔案。阿里巴巴表示,該模型將於下週透過其 Model Studio 平臺提供,開放權重隨後將上架 Hugging Face 和 ModelScope。
Model: Qwen3.8-Max | Total parameters: 2.4 trillion | Active parameters: 95 billion | Context window: 1 million tokens | Modality: text, images, video | Availability: Model Studio next week, open weights on Hugging Face and ModelScope
與前沿模型的跑分對決
阿里巴巴自家的測試描繪出一幅亮眼的成績單。在 Terminal Bench 2.1 等程式碼跑分中,Qwen3.8-Max 拿下 86.6 分,略勝 Claude Fable 5 的 84.6 分,但仍落後 GPT-5.6 Sol 的 88.8 分。在 PaperBench 上,它繳出令人驚艷的 93.0 分,遠超前方的 Fable 5(88.8 分)和 GPT-5.6 Sol(90.5 分)。該模型在 36 項多模態與視覺評測中也全面領先,包括在 RealWorldQA 上拿下亮眼的 88.0 分,相較之下 Fable 5 為 85.9 分、GPT-5.6 Sol 為 83.7 分。
該模型在 Arena.AI 公開排行榜上的名次,使其成為得分最高的中文文字模型,並在視覺分析專案上位居全球第二,僅次於 Anthropic 的 Claude Fable 5。阿里巴巴還宣稱,該模型在 16 天的自主運作中完成了一項內部軟體工程專案,包括撰寫程式碼、執行測試、修正錯誤並最佳化成果,全程無需人為介入。這項宣稱雖然令人印象深刻,但僅是該公司單方面的說法,尚未經過獨立驗證。
Key benchmark scores (Qwen3.8-Max vs. Claude Fable 5 vs. GPT-5.6 Sol): Terminal Bench 2.1: 86.6 vs. 84.6 vs. 88.8 | PaperBench: 93.0 vs. 88.8 vs. 90.5 | RealWorldQA: 88.0 vs. 85.9 vs. 83.7 | GPQA Diamond: 92.6 vs. 92.6 vs. 94.1 | MMMU-Pro: 82.3 vs. 81.2 vs. 83.0
引數量的問題
Qwen3.8-Max 的總引數量為 2.4 兆,略低於 Moonshot 的 Kimi K3(2.8 兆),但比較的重點與其說是原始規模,不如說是各模型如何運用其架構。混合專家設計意味著任何時刻只有一小部分引數處於啟動狀態,這正是回應速度和成本得以控制的原因。阿里巴巴表示,該模型使用 950 億個啟動引數,而 Kimi K3 為 1,040 億個,這項差異在大規模部署時可能轉化為可觀的成本節省。
中國開發者已將開放性視為其策略的核心。阿里巴巴公開引數數量和開放權重,而 OpenAI 和 Anthropic 則對這些資料保密。這種透明度正在贏得開發者的認同,並將工作負載吸引到阿里雲上,即使模型本身免費提供或以極低利潤出售,該公司仍可藉由執行這些模型所需的運算資源來收費。
Competitive context: Moonshot AI's Kimi K3 has 2.8 trillion total parameters and 104 billion active parameters; OpenAI and Anthropic do not disclose parameter counts for their flagship models
令人難以忽視的快速發布節奏
阿里巴巴策略中最引人注目的莫過於其迭代速度。該公司先前的旗艦模型 Qwen 3.7 僅在 Qwen3.8-Max 發表兩個月前推出。相較之下,Moonshot 在 Kimi K2 和 K3 之間花了整整一年。正如星展銀行資料科學家 Mehul Gupta 所言:「Qwen 團隊發布模型的速度開始令人咋舌。每隔幾週就有新版本、新的跑分攀升、又一次企圖稱霸推理排行榜。」
這種節奏是刻意的策略。每一次新發布都讓阿里巴巴持續佔據話題焦點,迫使競爭對手不得不回應,並逐步扭轉「美國實驗室高不可攀」的既有印象。該公司同時也在為機器人開發 AI 模型,並將 Qwen 整合進自身服務中,從雲端到消費者購物,讓每次發布都能立即觸及真實使用者。
並非一帆風順
崛起之路並非毫無波折。Anthropic 指控阿里巴巴對 Claude 發動了規模最大的蒸餾攻勢,稱其試圖複製這款美國模型的行為模式——阿里巴巴對此予以否認。美國政府也表示將調查中國 AI 模型是否蒸餾自美國模型,為這個本就競爭激烈的市場再添一層地緣政治色彩。
對中國以外的買家而言,問題在於:一款開放、更便宜的模型,是否已經夠接近前沿水準,值得因此轉換陣營?就這些跑分來看,阿里巴巴提出了極具說服力的論據。該模型的定價尚未公佈,但阿里巴巴近期幾款模型的價格已大幅低於西方競爭對手,而整個中國市場也正將成本一路壓向地板。這股壓力可能迫使 OpenAI 和 Anthropic 降價,並為開發者提供更具彈性的部署選項。
Qwen3.8-Max 的推出提醒了我們:AI 競賽不再是兩強爭霸。中國實驗室正以美國企業難以企及的速度推出功能強大的模型,而且它們以開放權重、積極定價和樂於分享細節的方式做到這點。下週開發者實際拿到 Qwen3.8-Max 之後,它能否維持排行榜上的位置,仍是個開放性問題。但就目前而言,阿里巴巴已經表明了立場:前沿領域不再是美國的專利。
