1. 现货与租赁:反向操作,锁定3个月租约
本周H100 80G现货均价降至$28.5/卡时(环比-3%),但8月起的云租赁价格逆势上涨(A100 40G按小时+6%)。建议:若你的推理负载稳定,立即签3个月及以上租约,锁定当前低点;若为短期测试,可拆分为周租+按需混合,避免为峰值买单。
2. IDC交付:拒绝‘裸金属承诺’,要求实测PUE与网络冗余
近期华东某IDC因冷通道故障导致机柜温度超标,客户服务器降频损失15%算力。执行建议:在合同附件中强制加入‘交付当日实测PUE≤1.3、双路冗余≥2N’条款,并保留48小时现场压测权利(可付费)。本周签约可要求免去首月带宽超量费。
3. 词元服务器:按‘每百万tokens成本’而非单卡价格比价
供应商报价差异巨大(如同等LLaMA-70B推理,某厂报价$0.8/百万tokens,另一家$1.2)。关键动作:用你的真实prompt+输出长度做一次7×24小时基准测试(工具:vLLM或TGI),并让供应商承诺‘吞吐抖动≤10%’。本周有供应商推出‘性能不达标按日退款’条款,建议优先选择。
4. 带宽网络:提前采购‘跨域弹性带宽’,避开下周云服务商大会流量高峰
下周三(8/14)多家云厂商召开AI基础设施发布会,预计网络拥堵将抬升跨域专线价格20%左右。执行清单:①本周内将常用训练数据预置到目标地域的OSS/对象存储;②开通‘按需带宽+保底包’组合,设定峰值自动降级策略;③与IDC确认是否支持IPv6+SRv6,否则叠加额外NAT网关费用。
5. 软件调度:启用‘词元感知’的负载均衡,降低单位token功耗
最新版Kubernetes + GPU Operator已支持按‘显存占用+token吞吐’动态分配pod。建议:升级到NVIDIA Device Plugin v0.15+,并开启‘binpack’策略,可将GPU利用率从平均42%提升至68%。本周NVIDIA发布补丁修复了MIG模式下的内存泄漏,务必今天内更新驱动到550.90.07。
6. 风险对冲:用‘区域分散’避免单一智算中心断电或限电
国内西南地区出现水电紧张预警,部分IDC可能限电。本周行动:将非实时推理任务调度到华北或东北节点;与云厂商签订‘跨区域故障转移SLA(RTO≤15分钟)’,同时利用Spot实例承接容灾流量(成本可降60%)。
7. 交付验收:保存‘词元服务器日志+带宽监控截图’作为结算依据
近期出现多起‘供应商声称交付但实际算力缩水’纠纷。建议:本周内为每个服务器开启GPU监控(dcgm-exporter),并配置带宽日志(netflow/sFlow)留存90天。在合同附件中注明‘实际可用词元吞吐低于承诺值90%时,按比例退款’,并让销售签字确认。
执行优先级提示:第2条(IDC实测)和第5条(软件调度)本周必须完成,其余可按资金和排期顺延。下周一早9点前,将上述清单发给采购与运维双负责人,避免口头承诺失效。



0 留言