商汤科技联合创始人、大装置事业群总裁 杨帆

出品|搜狐科技

作者|郑松毅

今年的WAIC展会逛下来,风向变了。以前大家盯着“人工智能”和“具身智能”,现在冒出一个存在感极强的新词——Token工厂。

啥是Token?它是AI推理和交互最基础的生产力单元,所有过程都得消耗它。而Token工厂,就是靠规模化、低成本手段,为AI算力与推理能力打底的核心底座。

随着Agent智能体大面积落地,全网Token消耗量直接爆炸。中国信通院副院长魏亮给了组数据:国内AI日均Token调用量从2024年初的1000亿,猛增至2026年3月的140万亿。两年时间,涨幅超过千倍,这标志着Token经济已经彻底成型。

中国工程院院士郑纬民指出,单套Agent任务的Token消耗,往往是传统聊天模型的百倍甚至千倍。眼下国内高端算力不够用,需求暴涨让供需失衡更严重,行业卡在“低端算力闲置、高端产能紧缺”的尴尬境地。

就在行业最难受的时候,2026WAIC期间,商汤大装置在上海办了场“算创·无限——Agentic时代AI基础设施创新发展论坛”,专门聊国产算力怎么规模化落地。

会后,针对国产算力差异化破局、太空算力布局这些热点,商汤科技联合创始人兼大装置事业群总裁杨帆,大装置事业群CTO宣善明,首席科学家张行程等高管,跟搜狐科技等媒体做了深度交流。

以下为对话精编:

媒体:商汤大装置为啥选国产异构混合算力这条道?

杨帆:硬拼单卡性能,性价比太低。国产芯片跟海外高端芯片比,确实还有差距。

所以我们换了个务实路子,搞PD分离异构混合推理。不指望单张国产卡能跟海外高端芯片一样强,而是把AI推理拆成两半分工干:吃算力、适合国产芯片发挥的上下文读取任务,交给国产卡;吃显存、要求低延迟的Token生成任务,交给高端芯片。各取所长,互补短板。

媒体:这套打法实际效果咋样?咋证明不是纸上谈兵?

杨帆:在上海临港智算中心自建测试里,这套混搭方案最高能把国产芯片利用率拉高152%。跟国产同构方案比,推理性价比能达到NVIDIA H系列的1.25倍,目前已经是正毛利了。

媒体:今年WAIC场馆里全是“Token工厂”,不少创始人说这行变红海了。你们怎么看?

宣善明:做Token工厂的企业真不少,类型五花八门。有特别传统的,也有特别新的,一二十个人就能搞一个,差别挺大的。

媒体:怕不怕自家策略被复制?商汤的技术壁垒在哪?

杨帆:商汤的优势不止技术,我们搭的是“技术-生态-商业”闭环。从“性价比、适配性、能效比”三个维度系统性地解题,推动国产算力从能用变成规模盈利。

媒体:Kimi最近发了K3大参数模型,坦言陷入算力短缺。模型越来越大还是趋势吗?这对Token工厂有啥挑战?

张行程:我们跟头部模型厂商交流密切,目前看,模型越来越大,万亿甚至几万亿参数的模型,还是主流趋势。

大参数旗舰模型给算力服务出了新题:模型参数巨大,但单次计算只动用少量专家,计算量增加有限。可巨量参数叠加大幅增加的上下文长度,对存储要求极严。不仅需要由显存、内存、高速存储组成的大规模KV Cache,还得配大显存GPU搭建PD分离分布式推理系统。

另外供应链也受限,高端算力芯片紧张,必须上下游深度绑定,从技术到供应链全链路把控,才能响应需求。

媒体:不少企业对国产算力还不信任,你们怎么打消客户顾虑?

杨帆:客户主要担心硬件性能、综合成本和使用信任这三层。

硬件短板没法一夜补齐,得联动整条软硬件产业链,慢慢缩小国产芯片与海外产品的性能差距。成本方面,Token需求暴涨带来规模化集中采购,加上异构调度大幅提高硬件利用率,Token生产成本在持续下降。全国一体化算力网落地后,跨区域协同调度还能进一步摊薄运营开销。

近半年我们跑出了日均万亿级Token服务能力,正在扭转行业对国产算力的刻板印象,愿意主动尝试的客户越来越多了。

媒体:商汤官宣布局太空算力,卷进马斯克的领域,为啥提前押注这种短期无收益的前沿?

杨帆:太空算力和量子计算都是长期战略储备,商业化最快也得三年后。现在提前布局,一是抢技术先发优势,二是抢稀缺的低轨太空资源。

未来有两个落地场景:一是配套自身遥感业务,比如为东南亚国家提供服务,解决应急救灾问题;二是覆盖地面网络够不着的偏远区域,通过星上算力直接输出Token和各类AI应用服务。

媒体:长远看,AI基础设施赛道终局拼的是什么?Token工厂未来会怎么变?

杨帆:短期行业还会陷入比拼硬件规模的内卷,但长期拉开差距的,一定是系统整合与全链路优化能力,这需要构建相当复杂的体系。

大家都觉得算力、AI基础设施是未来智能时代的水电煤,是个长周期持续高增长的大行业。但也正因为需求太大、增长太快,导致玩家专业度参差不齐——大量不具备持续经营能力的低效厂商扎堆进场,最终会在竞争中逐渐出清淘汰。

眼下产业链上下游还在快速迭代,基础设施服务商很难给出稳定成熟的方案。行业改善有两条路:一是等国产算力体系经过三至五年发展逐步成熟,产业链迭代波动会明显收窄;二是伴随头部专业厂商市场份额提升,低效落后产能被持续挤出,行业供给结构会进一步优化。