Kimi K3 改寫 AI 模型競爭格局:高效模型為何反而更需要算力?

fiisual

2026/8/20

中國 AI 新創月之暗面推出 Kimi K3,憑藉 2.8 兆參數、百萬 Token 長上下文與 KDA、AttnRes、MoE 等架構創新,整體性能緊追全球頂尖模型,同時維持更具競爭力的推理成本。K3 上線後算力迅速達到承載極限,也重新驗證傑文斯悖論:模型效率提升未必降低算力需求,反而可能加速 AI Agent 普及,進一步帶動 GPU、HBM、DDR5 與企業級 SSD 的需求成長。

Kimi K3 以強大性能震撼矽谷,改寫 AI 競爭格局

中國 AI 新創公司月之暗面(Moonshot AI)於 2026 年 7 月推出最新的大語言模型 Kimi K3。 憑藉強大的程式開發能力、百萬 Token 長上下文,以及多項在技術架構上的創新,Kimi K3 在效能上緊追在 Claude Fable 5 和 GPT-5.6 Sol 後,甚至僅憑藉開源工具,便能在 48 小時內自主完成一款功能性半導體晶片,迅速成為市場焦點,被視為「DeepSeek 時刻 2.0」,引發市場重新評估 AI 模型競爭格局,衝擊美股半導體。

而在 Kimi 3 發布後的 48 小時內,其便因用戶請求量大幅超乎預期,算力超出承載極限,宣布暫停 C 端新用戶訂閱。該消息一出,也讓過去市場對 AI 算力需求放緩、甚至出現供給過剩的疑慮重新受到檢視。

Kimi K3 以創新技術架構提升模型算力

Kimi K3 模型參數量超過 2.8 兆,具備 100 萬 Token 的上下文視窗,支援視覺理解,專為長程程式設計、知識工作和推理等前沿智慧場景而設計。

Kimi K3 的突破是基於 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes)兩項技術創新。

  • KDA 採用線性注意力替代絕大部分的傳統計算,同時僅保留少量全注意力層來應對需要精準檢索的複雜場景,將 KV Cache 佔用量大幅降低 75%,並在 100 萬 Token 的超長上下文下,將解碼吞吐量最高提升了 6 倍。
  • AttnRes 突破了傳統模型只能在層與層之間「逐層累加資訊」的限制,讓模型具備動態跨層檢索的能力,確保底層學到的特徵不會在經過深層傳遞時被忘掉。

此外,Kimi 3 結合 Stable LatentMoE 框架進一步提升了專家模型(MoE)的稀疏度,在多達 896 個專家中僅啟動 16 個,使模型回答時調用的計算量被限制。這些架構突破使 Kimi 3 相比前代 K2 的整體效率提升了約 2.5 倍。

K3 整體性能緊追 Fable 5 和 GPT -5.6 Sol,但成本更低

Kimi Fronted Code 能力位居第一示意圖。 資料來源:Arena AI Leaderboard

Kimi K3 在程式開發及軟體工程能力表現亮眼,在 Arena.ai 的 Frontend Code 排行榜上首次亮相即登上榜首,超過 Claude Fable 5、GPT-5.6 Sol 和 GLM-5.2。

Kimi 整體性能僅在 Claude Fable 5 和 GPT-5.6 Sol 後 示意圖。 資料來源:Artificial Analysis

在 Artificial Analysis 最新的綜合智能指數中,Kimi K3 拿到 57分,整體性能僅排在 Claude Fable 5 和GPT-5.6 Sol 之後,躋身目前全球頂尖模型梯隊。

Kimi 的每單位任務運行成本較中國模型高,但仍低於美國高階模型示意圖。 資料來源:Artificial Analysis

在定價上,K3 的輸入價格是 3 美元/百萬 token、輸出 15 美元/百萬 token,儘管定價創下中國模型的新高,但仍遠低於 Anthropic Fable 模型(輸入 10 美元、輸出 50 美元)。不過也需注意 K3 的 Token 效率較低、輸出偏冗長且速度低於同檔平均,根據 Artificial Analysis,K3 的平均任務成本為 0.94 美元,略低於 GPT-5.6 Sol 的 1.04 美元,但仍不到 Fable 5 (2.75 美元)的一半。

因此,憑藉著優越的性能以及相對便宜的成本,K3 在公布後即受到使用者的支持,使 K3 在發布後的 48 小時內算力即達到承載極限。

模型效率提升重新定義 AI 算力需求

過去兩年,AI 的敘事主軸多著重在「訓練一個模型需要多少 GPU」,隨著模型效率持續提升,市場甚至一度開始擔憂 AI 算力需求將逐漸放緩,甚至出現供給過剩的情況。

然而,Kimi K3 的推出打破了對算力過剩的擔憂。儘管月之暗面可能早已部署數千至上萬張 A800、H800 GPU 組成的高階推理集群,K3 發布後仍因用戶請求量遠超預期,短時間內逼近現有算力承載極限,月之暗面甚至宣布暫停 C 端新用戶訂閱,顯示算力需求並未因模型效率提升而下降。

正如傑文斯悖論(Jevons' Paradox)所描述,當技術效率提升、單位使用成本降低後,往往會刺激需求快速增加,使整體資源消耗不減反增。對 AI 而言,更具效率、低成本的模型成本降低了企業與開發者導入 AI 的門檻,部署 AI 的意願持續提升,推理需求快速成長,反而進一步擴大整體算力需求。

目前月之暗面、智譜、MiniMax 等獨立模型公司取得算力主要依賴租用公有雲服務或建置自有算力集群。前者受限於雲端資源供給,後者則屬於高資本支出且建置週期長,因此短期內算力供給難以快速擴張。中國信通院數據顯示,2026 年第一季中國 AI 算力需求年增 417%,同期算力供給僅成長 128%,需求增速約為供給的三倍。

另一方面,隨著長上下文模型與 AI Agent 應用普及,記憶體容量、資料存取速度以及模型參數傳輸效率逐漸成為推理效能的關鍵限制。SemiAnalysis 指出,K3 的參數規模超過 2.8 兆,模型權重容量本身即需超過 1.5TB 的 HBM。即便在使用者同時上線人數不多的情況下,KV Cache 仍需大量卸載至 伺服器 DDR5 記憶體與 NVMe 固態硬碟,顯示 HBM 空間並未因模型效率提升而出現明顯釋放。

隨著 Token 使用量持續增加,伺服器需要處理的資料交換量與推理負載同步提升,使高頻寬、高效能的 DDR5 伺服器記憶體成為關鍵。同時,AI Agent 大規模部署將提高資料儲存與高速讀寫需求,進一步推升企業級 SSD(eSSD)的容量與效能要求。

Blog Post Ad

其他標籤


Kimi K3 改寫 AI 模型競爭格局:高效模型為何反而更需要算力? | fiisual 部落格