问:本周到底发生了什么“黑天鹅”?
周二午后,某头部云厂商的AI推理集群因单日词元(Token)调用量突增320%,触发了区域IDC的带宽限速阈值。随后,依赖该集群的多个SaaS应用出现超时,连带影响电商推荐、在线客服等实时服务。事件持续约4小时,被业内称为“词元挤兑”。
问:为什么“AI词元”会压垮IDC?
传统IDC按峰值带宽预留资源,而AI推理的流量特征与网页浏览截然不同:单个词元请求虽小,但并发密度极高,且长连接占比大。当模型从“问答”转向“连续对话+多模态”,单位时间的网络软件调度开销呈指数上升。换言之,瓶颈不在算力,而在带宽与连接管理。
问:网络软件在这里扮演什么角色?
网络软件(如负载均衡、DPU卸载、RDMA调度)本应削峰填谷。但本次故障中,部分旧版调度器未针对“短词元、高并发”做优化,导致队列积压,重试风暴进一步放大带宽占用。教训是:IDC的软件栈必须与AI推理模式同步演进。
问:对普通企业和开发者有何影响?
短期看,API响应变慢、成本波动。长期看,企业需重新评估SLA:不能只看GPU可用性,还要看“词元吞吐”和“突发带宽”条款。开发者应增加本地缓存、异步队列和降级策略,避免把鸡蛋放在一个推理集群里。
问:下周及未来应关注什么?
一是IDC厂商是否会推出“词元带宽”计费单元;二是网络软件是否会内置AI流量整形;三是监管是否要求披露AI推理的容量冗余。黑天鹅不会最后一次出现,但每一次都在提醒:AI的尽头,是网络与带宽的硬约束。


0 留言