1. 微软Azure Cobalt 100正式商用:ARM架构对IDC机柜密度的真实冲击
本周Azure宣布基于自研ARM芯片的Cobalt 100虚拟机全区域上线。实测数据显示,同等vCPU数量下,其单核性能比上一代Intel Ice Lake提升40%,但更关键的是功耗比优化——在满载跑Llama-3-70B推理时,每机柜可部署节点数从6台增至9台。建议IDC服务商立即评估现有电力冗余与冷通道设计,若你的客户以AI推理为主,优先改造高密度机柜的液冷背板,而非盲目扩容总功率。
2. 谷歌发布TPU v5e性价比套餐:词元成本下降47%,但网络成新瓶颈
谷歌云推出按‘百万词元输出’计费的TPU v5e专属资源池,价格较A100同等吞吐低47%。然而,多家测试机构反馈,在跨节点张量并行场景下,由于依赖内部带宽,若你的IDC未部署400G RoCEv2网络,实际吞吐仅为基准的62%。可执行建议:若客户计划迁移TPU工作负载,提前确认你的网络交换层是否支持无损ECN(显式拥塞通知)与动态路由,否则省下的算力钱会加倍赔给带宽时延。
3. 英伟达Spectrum-X以太网方案落地:告别InfiniBand的IDC选型新逻辑
英伟达本周宣布Spectrum-X已支持DGX H100集群的以太网互连,吞吐仅比InfiniBand低5%,但运维成本骤降(无需专用线缆与IB网管)。对第三方IDC而言,这意味着不必再为AI客户强制预留IB端口。操作建议:将机柜内TOR(架顶交换机)升级为支持RoCEv2的25G/100G自适应端口,并部署基于意图的网络监控工具,否则带宽拥塞会导致AI训练作业频繁checkpoint回滚。
4. AWS推出‘词元网关’:软件定义带宽按需计费,打破传统月租模式
AWS本周发布私有预览版‘Token Gateway’,允许企业按实际处理的词元数量动态购买跨可用区带宽,而非锁定固定端口。这直接冲击IDC现行‘端口月租+超额罚款’模式。建议国内IDC运营商关注此动向,考虑将带宽计费颗粒度从Mbps改为‘每百万请求处理数’,并配套实时流量分析API,以匹配AI客户‘突发式训练、间歇性推理’的特征。
5. 软件层大洗牌:Kubernetes AI Operator成标准,但安全补丁滞后
红帽与SUSE本周同步推出面向LLM微调的K8s Operator,可自动扩缩GPU节点。但安全公司Sysdig报告显示,这些Operator默认开放的监控端口有23%暴露公网。给IDC的落地建议:若托管此类集群,必须强制启用网络策略(NetworkPolicy)隔离Pod间流量,并部署基于eBPF的异常检测,防止挖矿木马利用AI算力资源。别依赖云厂商的默认安全组。
6. 执行清单:本周可立即做的三件事
第一,重测你机房的PUE(电源使用效率):若高于1.4,优先改造冷通道封闭,而非采购新服务器;第二,对现有客户做一次‘词元吞吐’调研,根据其模型并发数规划带宽峰值预留,避免超卖;第三,联系你的网络供应商,确认能否提供200G端口的按小时弹性调度——这是应对AI负载最便宜的保险。别急着买最贵的设备,先让现有基础设施适配‘词元计量’的新商业逻辑。



0 留言