问:最近国产大模型能力提升很快,但价格反而在降,这符合逻辑吗?
表面看矛盾,实则不然。近期多家厂商推出新一代MoE架构模型,单次推理激活参数更少,但总参数量与知识容量不减。这直接降低了每AI词元(Token)的GPU计算量。更关键的是,IDC侧的变化:国产AI服务器普遍采用更高密度的GPU整机柜,配合液冷,单机柜功率从传统的8-12kW跃升至40kW以上,摊薄了单位算力的机房租金与电费。
问:那带宽和网络软件在成本里占多大比重?
过去容易被忽略,现在却成了胜负手。大模型训练时,参数同步对东西向流量要求极高。近期国产方案大量引入RDMA over Converged Ethernet(RoCEv2)和自研集合通信库,把网络时延从数十微秒压到个位数。同时,IDC内部署的智能网卡和可编程交换机,能动态调度AI词元传输路径。这意味着同样的服务器带宽,能跑出更高的有效吞吐——成本自然下降。
问:软件层面有哪些近期变化值得关注?
一是推理框架的“分离式部署”:把预填充和解码阶段拆到不同服务器,预填充用高算力GPU,解码用低功耗推理卡,再通过高速网络串联。二是国产化软件栈成熟,比如针对国产GPU的算子库和通信库优化,让训练效率从早期不到30%提升到50%以上。软件吃透硬件,才是降本的核心。
问:对普通开发者或企业,选择时该看什么?
别只盯每百万AI词元的价格。要问三件事:IDC是否支持高密部署和液冷?内网带宽是25G还是100G起步?是否提供RDMA和融合网络软件?同样标称“大模型API”,底层机房差一代,实际稳定性和并发成本可能差一倍。近期某国产模型降价后,有用户反馈高峰时段延迟飙升,根源就在IDC网络拥塞和服务器带宽超卖。
问:未来趋势如何?
能力与成本的剪刀差还会扩大。随着国产AI词元服务器规模化、800G网络逐步落地、以及网络软件定义算力调度,单位智能的成本会继续下探。但前提是IDC不再只是“机柜出租”,而是软硬协同的AI基础设施。谁能把服务器、带宽、网络、软件拧成一股绳,谁就能在下一轮竞争中掌握定价权。


0 留言