供应链中动态定价的多智能体强化学习:在真实模拟市场条件下对策略性智能体行为的基准测试
机器学习
2025-07-04 v1 计量经济学
摘要
本研究调查了多智能体强化学习(MARL)如何改进供应链中的动态定价策略,特别是在传统ERP系统依赖于静态的、基于规则的方法而忽略了市场参与者之间策略性相互作用的背景下。虽然最近的研究已将强化学习应用于定价,但大多数实现仍然是单智能体的,未能模拟现实世界供应链的相互依赖性。本研究通过评估三种MARL算法:MADDPG、MADQN和QMIX相对于静态基于规则基线的性能来填补这一空白,评估是在一个由真实电子商务交易数据和LightGBM需求预测模型提供信息的模拟环境中进行的。结果表明,基于规则的智能体实现了近乎完美的公平性(Jain指数:0.9896)和最高的价格稳定性(波动率:0.024),但它们完全缺乏竞争动态。在MARL智能体中,MADQN表现出最激进的定价行为,具有最高的波动率和最低的公平性(0.5844)。MADDPG提供了一种更平衡的方法,支持市场竞争(份额波动率:9.5个百分点),同时保持相对较高的公平性(0.8819)和稳定的定价。这些发现表明,MARL引入了静态定价规则无法捕捉的涌现策略行为,并可能为动态定价的未来发展提供信息。
引用
@article{arxiv.2507.02698,
title = {Multi-Agent Reinforcement Learning for Dynamic Pricing in Supply Chains: Benchmarking Strategic Agent Behaviours under Realistically Simulated Market Conditions},
author = {Thomas Hazenberg and Yao Ma and Seyed Sahand Mohammadi Ziabari and Marijn van Rijswijk},
journal= {arXiv preprint arXiv:2507.02698},
year = {2025}
}