1. 先算“词元账”:把病历结构化从GPT搬到小模型
近期多家医疗IT厂商开始主推“病历摘要+ICD编码”小模型。可执行建议:拿1000份脱敏出院小结做基准,分别用7B和70B模型跑一次,统计每份消耗的词元数。通常7B模型在实体抽取任务上词元消耗降低60%以上,且延迟从2秒级降到500毫秒级。先建一个Excel表:科室×任务类型×平均词元/次×日调用量,这是你向IDC申请算力时的第一张表。
2. 服务器选型:别只看GPU,盯住“词元/瓦”
本周某三甲医院影像AI项目流标,原因是推理卡功耗超出机房UPS余量。攻略:在IDC侧要求供应商提供“每瓦特词元吞吐”实测值。对于医疗问诊类并发不高的场景,L40S或A30的性价比可能优于H系列。另外,确认服务器是否支持NVIDIA MIG或vGPU切分——把一块卡切成3个实例给不同科室,能省下至少2台服务器的采购预算。
3. 带宽预留:别让PACS影像挤垮AI推理
近期某区域医疗云出现“AI读片延迟突然从300ms飙到4s”,根因是夜间批量随访数据上传占满上行带宽。可执行动作:为AI推理节点单独划一个VLAN,并做QoS限速。具体建议:按峰值并发数×单次请求镜像大小(如CT序列约20MB)预留1.5倍带宽。如果走5G专网,记得测试上行抖动——医疗影像上传对丢包率比问诊文本敏感得多。
4. 网络软件:用eBPF做“词元级”流量观测
本周CNCF医疗SIG分享了一个案例:通过eBPF在node上采集每个AI pod的词元输出速率,发现某开源模型在长上下文时产生大量无效重传。攻略:在IDC侧部署Cilium或Pixie,做两件事——第一,按HTTP/gRPC路径统计词元/秒;第二,对超过200ms的推理请求自动抓取前后10个包。这比等业务方投诉“AI又慢了”要提前至少半天发现问题。
5. 合规兜底:把“词元缓存”纳入等保范围
近期某省卫健委通报了一起因AI推理中间结果未加密存储导致的隐私泄露。行动清单:检查你的vLLM或TGI是否开启了磁盘KV缓存;如果开启,必须放在加密卷上,并设置TTL不超过24小时。同时,在IDC合同里明确“词元日志”的留存周期和销毁方式。一个可以立刻执行的检查命令:lsof | grep -i kv_cache,看看有没有明文落盘。
本周小结
医疗AI的下一阶段不是比参数,而是比“每词元每瓦特每毫秒”的工程精细度。从今天起,给每个AI服务打上三个标签:日均词元、峰值带宽、合规等级。下周你再向IDC提需求时,对方会知道你是个懂行的。


0 留言