DeepSeek V4 参数规模1.6万亿、Kimi 推出2.8万亿参数K3模型,阿里通义千问Qwen3.8-Max达到2.4万亿参数……当国内一众大模型参数迈入万亿界别,推理成本持续走高,依靠大规模堆叠GPU的传统算力模式,正在遭遇功耗、存储、综合成本多重瓶颈。
当下,AI算力竞争逻辑也悄然切换:比拼峰值算力的上半场落幕,有效计算、算力利用率、Token 性价比成为行业下半场核心命题。在刚刚过去的世界人工智能大会上,多家厂商也纷纷选择亮出“超节点”“算力集群”的肌肉,关注点从之前的单颗芯片的峰值算力,转向十万卡集群如何高效运转。
除了“超节点”这样提高芯片与芯片之间联通、协同效率的行业前沿方案,不少国内的AI芯片公司也在做更多面向未来的路线探索,比如稀疏计算。在推理时,稀疏计算可以只激活模型中的有效参数,跳过冗余计算,以实现同等精度下降低推理成本。
墨芯人工智能是稀疏计算领域的一家公司,也是国内稀疏计算领域的一个先行者。近期,财联社对公司的联合创始人、工程副总裁芦勇,以及市场部副总裁郭威俊进行了访谈。
跳出 “暴力堆算力” 困局,稀疏计算模仿人脑实现精准运算
“稀疏化技术本质上是一种激活技术,受到人脑启发。”芦勇解释道,比如人脑在思考时,运动神经不需要激活,这样会让大脑更高效。这种“按需激活”正是稀疏计算的核心思想。
“今年算力行业有几个特点,算力从训练需求往推理需求大规模转变;从算力提供的质量上讲,之前大家追求算力数量、堆GPU,但现在其实是在往质量、有效计算的方向转变。”芦勇指出。
芦勇以DeepSeek-V4-Pro举例:“它的模型参数达1.6万亿,相比上一代V3.2的660B参数,参数量增长了2.4倍,但激活参数仅从37B增加到49B,增幅远小于总参数的增长。”和大模型公司方向一致,稀疏计算本质上也是一种对激活范围的前沿探索,公司基于稀疏计算技术推出的芯片,正是这一方向的硬件实践。
暴力堆卡转变背后,是残酷的成本现实。比如大规模堆叠GPU芯片带来的不仅是采购费用,还有存储涨价、电费攀升、运维成本高企。“存储涨价很厉害,其实就是因为AI对存储的需求非常大。”芦勇说,“我们通过稀疏化,可以对存储、带宽进行节省,同时功耗也会下降。”
如何通俗理解呢?郭威俊则用“挂专家号”来比喻:“稀疏计算可以直接帮你挂专家号,不用先在外科、急诊各看一遍。”他进一步解释,大模型中绝大部分参数在特定推理任务中并不需要被激活,通过剪枝、动静态稀疏等手段,可以提前识别哪些系数该进入计算通道,哪些该跳过。
郭威俊表示,稀疏计算分为静态稀疏与动态稀疏,墨芯采用的是动静态结合的广义稀疏方案,在模型前训阶段提前识别可剪枝参数,推理阶段动态激活有效通道,在不降低模型精度前提下,提升每秒Token吞吐率。
“用户感知最直观的指标是吞吐率。” 郭威俊称,普通使用者不会关心芯片标称峰值算力,而是提问之后 AI 多久给出反馈。稀疏计算精准剔除无关计算任务,不再为无关参数消耗算力资源,直接改善用户响应速度,同时降低存储占用、功耗与整体 TCO(总拥有成本)。
芦勇在对话中总结:未来 AI 发展,不再是 “算力越大越好”,而是计算更聪明。尤其面向具身智能、空间计算、物理 AI 场景,二维图像识别之外,三维空间存在海量无效像素,稀疏计算的价值会进一步放大。
聚焦推理赛道,二代SparsePrime®加速卡下半年推向市场
算力市场需求结构正在发生根本性转变:行业需求从前期大规模模型训练,逐步向海量商业化推理倾斜。多位产业人士预判,当前训练、推理算力需求大致五五开。长期看算力需求重心持续向推理转移,未来推理与训练算力占比或将达到七三、八二甚至九一开。
“训练市场规模仍会持续扩张,但推理场景遍布千行百业,智能办公、金融、医疗、自动驾驶、AI 短剧生成,每一个场景都持续产生海量 Token 需求。” 郭威俊坦言,基于技术基因与产业趋势,墨芯长期锚定推理赛道,但并未放弃训推一体技术储备,产品规划保持弹性。
记者也发现,当前芯片迭代节奏也在提速,很多AI 芯片企业已经进入一年一代的迭代周期。据公司透露,墨芯初代产品 S40 等计算卡主要面向视觉小模型推理;今年下半年,公司将推出面向智算中心和数据中心的高性能AI通用推理计算卡SparsePrime®,也就是二代卡,定位智算中心、数据中心场景,适配大模型及各类复杂推理任务。
据公司透露,明年将推出二代卡 Plus 升级版本,目前已经启动三代卡预研,预计 2028 年底完成回片。三代卡将瞄准世界模型、GPU领域,适配物理 AI、多模态感知、具身智能未来需求。
从一代卡到二代卡,甚至未来的三代卡,墨芯的迭代脉络也可见一斑。从早期S40、S4等产品更多关注视觉小模型,而二代卡直接锚定头部大语言模型推理、世界模型、物理AI。郭威俊表示:“现在AI下游终端变化很快,做芯片等硬件产品的厂商更需要有前瞻性的,不能只是闷着头干,而是要穿过周期,还要能看见未来需求。”
共建国模国芯生态:搭建标准、产学研联动,推动算力普惠
“国模国芯不只是硬件适配,更需要整套软硬件协同标准、人才体系、产业生态共同支撑。” 在采访中,郭威俊多次强调生态建设的长期价值。
当前国内 AI 产业链尚缺少统一规范,算力性能评测、高质量 Token 界定、稀疏计算评测基准等行业标准仍处于起步阶段。
“我们国家非常缺少AI领域的标准——从芯片制造、生产、性能,到算力Token什么叫高质量、什么叫低质量,都大有可为。”郭威俊透露,墨芯已与信通院、赛迪研究院等机构合作,推动稀疏计算相关标准建设,并联合复旦、西安交大等高校开展稀疏训练和矩阵计算的基础数学研究。
在产业链合作上,“国内多数芯片与大模型企业相互独立,但同样可以配合默契,在产业链上实现协同。” 郭威俊表示,墨芯选择软硬件协同路线,一方面和国内头部大模型厂商深度适配,在模型层面预埋稀疏因子;另一方面推进产学研攻坚,布局稀疏训练前沿课题。目前墨芯与复旦、西安交大、清华大学等高校合作攻关。
外界关注,国内先进制程面临约束,墨芯如何突破?郭威俊表示,技术路线不能单纯内卷先进制程。“未来比拼的不是单张芯片制程,而是谁的软件生态更丝滑,谁更懂计算什么该算、什么不该算。”
谈及国产芯片突围思路时表示,芦勇认为,国内 AI 芯片创业企业不必单纯复刻海外巨头路线,具备走出超越性技术路径的机会。稀疏计算正是国产算力差异化突破口,依靠底层架构创新,打造绿色高效算力底座,支撑物理 AI 时代到来。
在对话的过程中,也反复提及了国芯、国模的生态建设。芦勇,除单芯片优化外,超节点、多芯片集群互联现在已经成为国产算力重要突围路径。“作为一家国产芯片厂商,我们不是在单打独斗。”
业内人士分析,依托当前国内通信互联产业优势,通过多芯片集群搭建千卡、万卡智算集群,搭配稀疏计算降低单机功耗,软硬方案协同形成完整算力解决方案,成为国产算力生态重要发展方向。










粤ICP备2021128059号 