AIM-Bench:评估具备代理性大语言模型在库存管理中的决策偏差
人工智能
2025-08-18 v1
摘要
近期在数学推理与大语言模型(LLM)长期规划能力方面的突破,催生了代理系统(agent),其正被广泛应用于业务运营流程。优化库存水平的决策模型是运营管理的核心要素之一。然而,面对不确定情境下的库存决策,大语言模型代理的决策能力,以及其决策偏差(如框架效应等)仍鲜有探讨。这引发了关于大语言模型代理有效应对现实问题的能力潜在疑虑,以及可能存在的偏差对业务的潜在影响。为填补这一空白,我们提出AIM-Bench——一个新颖的基准测试旨�通过多样化的库存补货实验,评估大语言模型代理在不确定供应链管理情境下决策行为。我们的结果表明,不同大语言模型通常呈现出类似于人类所观察到的不同程度的决策偏差。此外,我们探讨了缓解“中心拉拽效应”和“牛鞭效应”的策略,包括认知反思与信息共享实施。这些发现凸显了在部署大语言模型进行库存决策情境时,对潜在偏差需予以谨慎考量的必要性。我们希望这些洞见能为缓解人类决策偏差、发展以人类为中心的供应链决策支持系统铺路。
引用
@article{arxiv.2508.11416,
title = {AIM-Bench: Evaluating Decision-making Biases of Agentic LLM as Inventory Manager},
author = {Xuhua Zhao and Yuxuan Xie and Caihua Chen and Yuxiang Sun},
journal= {arXiv preprint arXiv:2508.11416},
year = {2025}
}