一、本周价格快照:别只看显卡单价
本周主流算力平台(阿里云、UCloud、智算中心)的单卡A100-80G租赁价维持在8.5-11元/卡时,环比下降约3%。但注意:H800的稀缺性推高至19元/卡时,且多数平台要求整月锁单。新手最常犯的错误是只比显卡价格,忽略了配套的NVLink带宽费用——某平台本周将内部互联带宽从'免费'改为按0.8元/Gbps/天计费,导致8卡训练任务实际成本上升12%。
二、词元(Token)计费陷阱:看似便宜,实则翻倍
本周有平台推出'按输出词元计费'模式,标价0.00012元/词元。但实测发现:该价格不含输入词元(约贵0.5倍),且未包含推理时的KV Cache显存占用费。避坑步骤:① 用你的真实Prompt和输出长度,让平台给出端到端总价;② 要求写明'失败重试是否计费';③ 对比传统按时租,若日调用量低于5万次,按时租通常更划算。
三、IDC机柜:'电力包'比带宽更坑
本周华东某IDC推出'AI专用机柜',宣传语是'免费送100M带宽'。但细则里藏着电力超配费:单机柜功率超过8kW后,超出部分按0.15元/W/天收费。若你部署4张A100(功耗约2.5kW),看似安全,但加上交换机、存储后,实测功率达9.2kW,每日额外支出约180元。正确姿势:签约前要求提供满载功耗模拟报告,并写入合同'超配费上限'条款。
四、网络延迟与丢包率:价格表里不显示的成本
本周北京某平台降价10%吸引用户,但实测跨区域调用延迟高达380ms(正常应<80ms),且丢包率在晚高峰达4.7%,导致分布式训练频繁断点。避坑方法:① 用ping和iperf3实测三天(含周末);② 要求平台提供SLA(服务等级协议),明确丢包率≤0.1%;③ 若用于大模型微调,务必测试梯度同步时的带宽稳定性——本周就有用户因某云厂商突发限速,导致4小时训练白跑。
五、软件生态费用:最容易被忽视的'隐形税'
本周行业内出现新玩法:基础镜像免费,但预装PyTorch+CUDA优化包额外收5%租金属性费。更有平台对API调用收取0.3元/千次'网关费'。新手建议:① 优先选择自带开源镜像的平台(如RunPod、AutoDL);② 若必须用特定框架,请对比容器启动时长(本周最优平台平均47秒,最差平台12分钟);③ 关注数据迁移费——某平台下载训练数据集收0.1元/GB,一次100GB迁移就是10元,看似小钱,但频繁迭代时非常肉痛。
本周总结:三个必做动作
1. 拿真实训练脚本(非Hello World)到3个平台跑1小时,看总账单;2. 询问客服'如果发生硬件故障,剩余租金怎么退'——本周有平台只退50%;3. 关注下周NVIDIA财报,预计H20新卡将冲击中端租赁价格,等一周再签长租合同可能省15%。新手记住:算力租赁不是买白菜,是买整套SLA。


0 留言