这周的工作日志核心就两个字:换线。起因是机柜里新增了两台用于大模型推理的AI服务器(单机8卡),结果一上线就出现训练任务中断,ping网关延迟波动超过200ms。查了三天,最终定位是旧网线(Cat5e)在万兆光模块下跑满了,而且核心交换机的QoS队列没有为AI流量单独划分。
第一步,物理链路摸底(耗时半天)。别急着下单买新设备。先拿测线仪和光功率计把所有涉及AI服务器上联的链路都测一遍。我们踩的第一个坑就是:看着交换机端口是10G up状态,实际光模块接收功率只有-19dBm(阈值是-15dBm),属于“假链路”。避坑点:必须用ethtool -m 查看光模块DDM信息,不要只看端口亮灯。同时,检查机柜内走线是否与强电交叉,这周就发现一条网线贴着UPS输出电缆,干扰明显。
第二步,带宽规划与交换机配置(核心步骤)。我们机房的出口带宽是2路10G电信+1路10G联通(BGP)。这次升级重点是把AI服务器单独划到一个VLAN(ID: 120),并在核心交换机(华为CE6850)上做三层策略路由。具体命令不细说,但思路是:给AI流量打上DSCP EF标记,然后配置拥塞管理——优先保证视频流和SSH管理,其次才是大文件备份。坑点警示:新手容易忽略STP(生成树)收敛时间。我们在接入交换机上误开了RSTP,结果一插新线,全网广播风暴3秒。切记:对于直接上联的服务器端口,要设置edge-port并关闭BPDU过滤。
第三步,软件层与AI业务联动测试。硬件和网络调通后,我们用iperf3打流到6Gbps稳定不掉包。但真正难的是让AI框架(比如PyTorch分布式)识别新网络。这里有个必须改的地方:NCCL环境变量。由于我们启用了RoCE(RDMA over Converged Ethernet),需要设置 NCCL_IB_DISABLE=0 且 NCCL_SOCKET_IFNAME=eth5(绑定AI专用网卡)。如果不做这步,即使物理带宽够,多卡通信仍会走TCP回退,训练速度慢5倍。另外,千万别忘了在安全组/iptables里放行新VLAN的8600-8700端口段(NCCL默认范围),我们因为这漏配,整整排查了4小时日志才发现是防火墙丢包。
最后提一下本周行业讯息关联:随着国内智算中心建设加速,三大运营商本周陆续下调了跨省BGP带宽单价(约10%),但接入侧的光模块价格因GPU服务器需求暴涨而缺货。如果你也在规划升级,建议提前囤2-3个备用的400G SR8模块,并考虑将监控软件从SNMP v2升级到v3,因为v2的明文团体名在VLAN隔离后很容易被AI业务扫描器探测到,存在配置泄露风险。
总结避坑清单:① 新服务器上线前做72小时老化测试(包括夜间温度波动时段);② 每个机柜预留至少20%的配线架余量,这周我们因为一个理线环堵住,多花了2小时熔纤;③ 升级后别忘了修改备份策略——原来的每日凌晨2点全量备份现在会撞上AI训练checkpoint写入高峰,建议错峰到4点。


0 留言