自主 AI 代理在供应链管理中的可靠性与有效性
人工智能
2026-05-27 v3 机器学习
多智能体系统
系统与控制
系统与控制
摘要
本文研究了基于 MIT 啤酒游戏的自主生成式 AI 代理在多级供应链中的应用。我们识别出四个推理时机杠杆,用于塑造绩效:模型选择、策略与监狱、集中数据共享以及提示工程。模型能力是决定因素:即插即用推理模型超过人类水平性能,优化后的推理模型可将成本降低最高 67%。然而,强大的平均性能掩盖了显著的可靠性风险。我们提出了代理牛鹿效应:即在自主多级体系中,决策不稳定性的放大效应。其核心组成部分是决策牛鹿,即订单变异性中由随机代理决策产生的部分,而非由客户需求变化引起。我们展示,即使需求路径保持不变,决策不稳定性也能在固定时间点 across 设施之间放大,或在同一设施内部时间维度放大。重复抽样——一种自然的测试时 remedy——未能显著降低这种不稳定性,这表明可靠性需要改变底层决策策略而非仅仅对模型输出进行平均。为解决这一局限,我们提出了基于群相对政策优化(GRPO)的强化学习后训练框架,该框架使用系统级供应链奖励训练共享基础 LLM。后训练显著降低了尾部事件,抑制了代理牛鹿效应,提高了自主供应链代理的可靠性。
引用
@article{arxiv.2605.17036,
title = {Reliability and Effectiveness of Autonomous AI Agents in Supply Chain Management},
author = {Carol Xuan Long and David Simchi-Levi and Feng Zhu and Huangyuan Su and Andre P. Calmon and Flavio P. Calmon},
journal= {arXiv preprint arXiv:2605.17036},
year = {2026}
}