Loading...
2026年,Agent的热度达到了前所未有的高度。根据IDC在AICC 2026大会上的数据显示,全球活跃Agent数量从7940万预计将在2030年增至22.16亿,Token的消耗量也将从2026年的0.026Peta激增至2030年的152667Peta。这意味着Agent数量增长了约28倍,而Token的消耗则增长了数百万倍,面对如此迅猛的需求增长,算力供给能否跟上成为了一个紧迫的问题。
典型的案例有两个:一是Kimi K3,这一拥有2.8万亿参数的模型,其权重文件达到1.56TB,而普通的AI服务器因显存不足,无法承载这样庞大的数据,需至少64个GPU或更大规模才能运行。这反映了“向上”的挑战:随着Agent需要更强的推理能力和更长的上下文,部署门槛正从单机提升至集群。
另一个例子是DeepSeek,该公司在2026年上半年将V4-Pro的API价格降了75%,宣称这是长期有效的措施,但到了8月又预告整体提价,理由是“算力不足”。这表达了“向广”的困境:当Agent大量调用低成本的模型时,对性价比的算力需求迅速增长,这造成了容量不足,低价供给难以维持。 龙8头号玩家
在AICC 2026大会上,浪潮信息提出了应对之策:在“向上”和“向广”两个方向共同推进,并发布了元脑SD200 Ultra超节点AI服务器和元脑HC2000多元算力机组,以实现从算力提供转向智能生产。
在“向上”方面,超节点技术打破了智能计算的上限。过去对AI的需求以单次问题回答为主,而在Agent时代,用户的一个意图可能需要数十次甚至数百次的推理,多个Agent需要进行长时间的协作。前沿模型的快速扩展,例如Kimi K3,要求更强的计算能力和更高的效率。为了应对这一需求,浪潮信息设计的SD200 Ultra超节点AI服务器,采用128芯本土AI芯片,实现统一的内存寻址和低延迟通信,并通过优化算子减少数据搬移,提升了整体性能,使得该服务器能够在单机上运行Kimi K3并将Token生成延迟降到了一项创新的5.85毫秒,同时也支持未来10万亿参数的模型。
在“向广”方面,随着Agent数量和使用频率的增加,Token需求还将继续快速攀升,因此提升单位计算资源的Token产出是关键。然而,提高Token产出并非易事,因为推理的计算模式复杂多样,考虑到不同模型的特点,简单堆叠更多服务器并不能线性增加能力,反而可能导致资源浪费。通过科学的架构设计和资源的高效利用,才能确保智能的供给既充足又经济。 龙8头号玩家