本周最核心的政策调整在于“AI词元计数”规则:托管平台开始对仓库内被AI工具(如Copilot、CodeWhisperer)索引的代码块按词元(token)计量,超过免费额度的部分将按每百万词元收费。同时,针对大文件(>100MB)的LFS(大文件存储)带宽从“不限”改为“按出站流量计费”,且强制要求走指定IDC机房线路。这意味着,如果你在仓库里直接存放模型权重或高频调用AI补全,账单可能在一夜之间翻倍。
场景一:预算有限的个人开发者或开源项目(月支出<50元)
需求是保住核心代码且不被AI词元收费拖垮。建议立即拆分仓库:将含训练数据的文件夹迁移到自建Gitea(部署在1核1G的轻量云服务器),只保留纯净源码在GitHub公共仓库。同时,关闭该仓库的AI索引开关(Settings -> Code security -> AI-powered features -> Disable),这样词元消耗归零。对于超过100MB的单个文件,不要用LFS,改用对象存储(如Cloudflare R2免费10GB)并通过git-lfs的URL重定向引用,出站流量走R2的CDN而非平台带宽。
场景二:中型商业团队(月预算500-2000元)
痛点在于带宽配额与IDC专线。新政策要求LFS文件必须回源到指定IDC(如Equinix或万国数据),否则限速至1Mbps。建议将全部大文件迁移至团队自建的MinIO集群,并通过专线(或VPN)与托管平台建立“私有网络对等连接”,这样出站流量计入私有链路,不占公网配额。同时,在CI/CD流程中增加“词元预扫描”步骤,用开源工具(如grep + tokenizer脚本)标记高消耗文件,将其移入独立子模块,并在.gitattributes中标注为“-linguist-detectable”,避免被AI索引。
场景三:AI原生企业(月支出>1万元,需要合规与高性能)
最新政策中最容易被忽略的坑是:“模型权重仓库”被要求额外签署数据驻留协议,且每次git pull会触发全量词元审计。更优解是放弃传统git托管,采用DVC(数据版本控制)+ 自建GitLab Runner。将代码与数据彻底分离:代码走GitHub(关闭AI功能),数据用DVC指向内部IDC的S3兼容存储。针对带宽,建议与平台签订“带宽包年”合同,同时将热数据前置到托管平台所在城市的边缘节点(通过Anycast加速)。本周实测,此方案可将AI词元费用降低约90%,且pull速度不受LFS限速影响。
最后提醒:无论选择哪条路,务必在本周五前导出所有仓库的Release与Issue元数据,因为新条款中对“非活跃仓库(超180天无提交)”的数据保留期将从永久缩短至90天。迁移时,使用git clone --mirror保留全部引用,避免历史提交丢失。



0 留言