主要内容
NVIDIA正借助Palantir Foundry和cuOpt,自动化全球制造基地的硬件供应链分配决策。公司测量从晶圆出厂到首个令牌的交付周期,该周期分为“时间到机架”(从晶圆厂输出到组装数据中心系统的运输时间)和“时间到令牌”(涵盖供电、制冷、网络及首日软件就绪情况)。
硬件扩展加剧了供应约束。NVIDIA Grace Blackwell NVL72机架含18个计算托盘,每个托盘需2个Grace CPU、4个Blackwell GPU及32个HBM3e内存包,组件来自数千家供应商。Vera Rubin架构的供应链规模是Grace Blackwell的两倍,需通过直接库存、寄售库存和外部供应商三个渠道获取部件,部件延迟到货会延长“拥有时间”(设施接收材料至完成子组件发运的时长)。
为协调依赖关系,NVIDIA用Palantir Foundry构建“数字供应链智能指挥中心”,将工厂、供应商承诺、部件库存和生产目标建模为互联对象。cuOpt(GPU加速决策优化开源库)通过混合整数线性规划模型最小化“拥有时间”,评估各层级物料清单的部件约束,输出每周交付计划并识别工厂限制(如区域组装产能与内存供应矛盾)。
数学优化难以捕捉供应商通话记录、天气、邮件及地缘政治等非结构化变量。NVIDIA训练Nemotron 3.5 Lightning(300亿总参数的开源混合专家模型),通过NeMo工具链处理敏感数据脱敏、平衡训练样本与合成中断场景,Palantir Autopilot管理数据谱系和模型追踪。
经历史分配记录测试,训练后的Nemotron 3.5 Lightning决策准确率达86.7%,远超未调整基础模型(17.5%)和更大模型(55.5%),在B200 GPU上几分钟内完成微调。未来,运营反馈将形成强化学习的偏好对,进一步优化分配精度与政策。