01、K3爆火,Kimi却不得不按下暂停键。

7月19日深夜,月之暗面Kimi团队发布公告,因Kimi K3上线48小时内,用户请求量大幅超出预估,由于算力资源紧张,暂停开放Kimi新用户订阅,将有限算力优先保障现有订阅用户。

会员体系随之拆分为Kimi主权益与Code权益,意图精准分配资源。稍后官方回应透露,Kimi并未对会员体系进行调整,只是在有限的算力资源下对用户体验进行了重新平衡。

换言之,K3的火爆导致算力系统面临压力,不得不谢绝新客,专注服务老用户。

Kimi的“韬定律”

眼下,众多模型厂商都在全力扩充用户规模,通过免费、降价等手段吸引新用户。相比之下,Kimi的逆向操作显得尤为特别。

但模型越强大、承载上下文越长、用户调用越频繁,对推理算力的需求也越高。当“K3的请求量几乎达到现有算力集群的极限”时,Kimi也遭遇了“豆包式”的困境:C端用户增加迅速,对营收的贡献并不显著,而GPU承受着巨大压力。

作为月之暗面首款拥有3万亿参数的MoE模型,K3的总参数量达到2.8万亿。一般而言,这类规模的模型每次输出都需要大量算力。不过,凭借其独特核心架构,K3实现了华为在芯片领域提出的“韬定律”效果。

这个架构被视为一种超级动力装置,成功应用了三项关键技术:KDA(Kimi Delta Attention)混合线性注意力、注意力残差(Attention Residuals)以及高稀疏度MoE,将每单位算力转化为模型效果的效率推向极致。

长期以来,芯片产业依靠摩尔定律,通过缩小晶体管尺寸来提升性能。然而,当先进制程逼近物理极限、制造成本急剧上升,单纯的硬件堆砌模式逐渐陷入困境。

华为近期提出的“韬定律”,突破了“空间压缩”的传统模式,转向“时间压缩”:借助逻辑折叠、三维堆叠、全链路架构优化,缩短信号传输延迟、减少数据重复传输,在标准制程上实现了媲美先进制程的能效提升。

其核心原则是:在硬件受限或成本控制下,借助系统级架构创新实现性能突破。

在我看来,K3所应用的KDA混合线性注意力机制,正是AI领域的“韬定律”实践。

需要了解的是,Transformer架构在注意力机制上消耗大量算力。标准注意力机制的计算复杂度随序列长度呈平方级增加,百万级上下文任务中,大部分算力用于维持长序列的注意力矩阵。KDA机制将大部分注意力层的计算复杂度从平方级降至线性。

根据月之暗面先前发布的技术文档,在实验中使用KDA与MLA混合比例,KV缓存占用减少高达75%,100万上下文长度下的解码吞吐量提升至原本的6倍。结合注意力残差与高稀疏度MoE技术,训练效率提升约25%,额外投入成本不到2%。

这是对“模型生产效率”的重新定义。如果硅谷主流的Transformer路线是“高投入高回报”的燃油车,KDA则像是追求“极致热效率”的混合动力引擎。

SemiAnalysis的报告显示,KDA将推理速度提升300%,同时在长上下文处理上仍接近Transformer的性能。这意味着同等算力投入下,K3能生成更多有效智能。

开发者社区的实测反馈,K3在长流程Agent任务和代码生成方面的表现优异,具备了与国际顶尖模型竞争的能力。

从根本上说,K3依然遵循Scaling Law(缩放定律),但目标直指算法浪费的粗放模式。当硅谷AI企业还在不断扩充GPU、增加算力时,Kimi通过重组算法链路、减少计算冗余,在有限算力的约束下,实现了性能与成本的平衡,探索出一条“每瓦特智能产出比”最大化的道路。

这让华尔街的分析人士和投资界感到震惊,他们和DeepSeek一样,开始质疑硅谷数百亿美元的AI投资是否获得了相应回报、美国AI的领先地位是否正在减弱。

与此同时,企业用户和开发者也日益关注AI使用成本。部分开发者已经采用“模型路由”(Model Routing)服务,依据任务需求自动选择成本最低、效率最高的AI模型,其中当然包括Kimi在内的中国模型。

杨植麟的挑战

回溯来看,Kimi算力超载是技术成功的副产品:模型效率的提升降低了单次使用成本,反而促进了需求总量的激增。

值得一提的是,7月11日,智谱的创始人唐杰提出了“Touch High摸高计划”,直言“未能达到顶峰即为失败”,并明确表示接下来两年将牺牲短期盈利,集中资源攻克AGI的四大核心领域,并计划筹资,目标是用百亿级资金突破机械可解释性技术。

可以说,智谱的“摸高”是上市后的关键抉择。其意图通过挑战技术极限,来巩固“全球市值最大AI公司”的形象,并缓解现实压力。

从杨植麟的决策中,也能看到Kimi在三个层面的“摸高”:

首先,算力层面的摸高,从流量导向转向价值导向。公开资料显示,Kimi的API业务占比已突破70%,与此前主要依靠C端订阅模式形成鲜明对比。保存量用户、谢新用户,实则是将有限算力倾斜至高价值场景,防止泛C端流量挤占已是营收支柱的B端业务份额。

其代价也是显而易见的。例如“优先保障存量用户”的执行标准缺乏透明度,哪些请求会被优先处理、哪些会被降级,一旦处理不当,都会损害用户信任。

长远来看,Kimi要完成从技术新秀向成熟AI龙头企业的转型,就必须强化弹性算力池、分级响应机制、动态调度能力等基础建设。

其次,定价层面的摸高,Kimi正从低价自助模式向价值分层模式进行压力测试。公告中提到的“拆分Kimi主权益与Code权益”,既是应对算力短缺的短期策略,也可能暗示其定价体系将迎来改造。

过去,无论用户用于编写代码、查阅资料还是闲聊,都支付相同费用、消耗相同算力。当高算力消耗的Code用户比例提升,这种模式必然造成结构性失衡。

Kimi借此机会拆分会员权益,也是在按使用场景重新定价:轻度用户享有基础服务,重度用户需为高级功能支付额外费用。

这是通过价值用户分层,尝试争夺模型产品的定价主导权。目前,K3的收费标准已达到每百万Token 2.3美元,虽低于海外头部模型,但已创下国产模型的新高。

或许,Kimi也想摆脱低价策略,向市场传递一个信号:高性能模型具备确立自身价格的能力。未来的AI大模型竞争,也将从“比拼参数”转向“比拼基础设施”、“比拼成本定价”。

这一步,比登顶排行榜更艰难,也更贴合商业本质。

第三,地位层面的摸高,Kimi从地缘性变量转变为定价参照点。

K3问世后迅速获得全球瞩目。在独立AI模型评测机构Artificial Analysis发布的最新“智能指数(Intelligence Index)”中,其综合得分达到57分,位列全球第三,仅次于Claude Fable 5(60分)和GPT-5.6 Sol(59分),超越Claude Opus 4.8(56分)。

这个成绩,也打破了“开源模型落后于闭源模型半代”的行业认知。

与此同时,K3的影响力已超出技术范畴。美国科技投资机构将其视为AI发展的转折点,认为高质量开源模型正在加速能力扩散;加州大学伯克利分校的计算机科学教授声称,K3将中国开源模型与美国先进模型的差距缩小至2至3个月。

资本市场的反应同样激烈,K3发布的首个交易日,英伟达单日市值蒸发约1111亿美元;摩根大通策略师在报告中直接将K3称为“DeepSeek 2.0”。

这种加速效应,才是改变定价逻辑的关键因素。

此外,月之暗面ARR(年化收入)至6月已接近3亿美元,海外用户增长400%,即便涨价60%后收入依然增加,这三组数据相互印证,显示Kimi的“开源+效率”模式具备规模化盈利潜力。

加上消息透露,月之暗面正计划最快六个月内于香港上市,估值在半年内从43亿美元飙升至315亿美元,涨幅超过7倍。

这些都是资本市场对非硅谷主流路径的“认可”。它们为“能够实现单位经济模型的SOTA”投资时,也表明Kimi已形成独立估值逻辑,无需与OpenAI或Anthropic相比来证明自身价值。

但K3距离AGI仍有遥远距离。比如跑分测试,尽管K3仅比Fable 5低3分,但两者间仍存在明显差距。

另外,Kimi在技术报告中承认了两个部署层面的不足:一是K3在训练中保留了完整的历史推理过程(thinking history),如果调用方未能正确传递之前的推理状态,或在会话中切换到K3,输出质量会大幅下降;二是K3在任务模糊时会“过度主动”,更倾向于替用户做决策。这种“自作主张”在需要精确执行的工程场景中,容易引发连锁错误。

还有一个容易被忽视但至关重要的点:幻觉。Artificial Analysis在测评中特别指出,K3的幻觉率较上一代K2.6有所上升。

某种程度上,K3的亮眼表现与潜在问题,是整个行业算力供需失衡的写照,也是中国AI产业在算力卡脖子、商业模式未完善、用户期望过高等多重压力下的共同挑战。

这些AI公司的每一次超负荷运行、每一次“熔断”,都是中国AI“摸高”过程中必须克服的难关。可以预见的是,新的竞争阶段已经到来,AI大模型将从单纯比拼能力转向比拼算力基础。

谁能在算法、算力储备等基础建设上占地优势,谁将赢得最终胜利,并定义下一代AI企业的生存标准。

参考资料:

字母榜,《K3发布48小时》

锦缎,《都怪Kimi》

我是唐辰同学,专注互联网科技及AI新经济。原创内容,欢迎分享,严禁未经许可的转载。

「唐辰同学」

钛媒体、36氪、老虎财经热榜

澎湃新闻2024年最澎湃创作者

老虎财经2024年度优秀专栏

河南日报·顶端新闻2024年度影响力作者

界面新闻优质榜单

老虎财经2024年度优秀专栏

腾讯新闻年度优质热问答主

2023搜狐新闻年度优质创作者

人人都是产品经理2023年度优秀作者

2023网易新闻年度内容合伙人

界面、36氪、钛媒体、澎湃、21财经、蓝鲸、老虎财经等平台专栏认证作者

文章配图-1