中文

用于动态定价与补货的双智能体深度强化学习

机器学习 2024-10-29 v1 综合经济学 经济学

摘要

我们研究了决策频率不一致下的动态定价与补货问题。不同于传统的需求假设,需求的离散性以及作为价格函数的泊松分布参数给分析问题性质带来了复杂性。我们证明了单期利润函数在其各自定义域内关于产品价格和库存的凹性。通过整合一个基于决策树的机器学习方法,并利用全面的市场数据进行训练,需求模型得到了增强。我们采用双时间尺度随机逼近方案来解决定价和补货决策频率之间的差异,确保收敛到局部最优。我们通过结合深度强化学习(DRL)技术进一步改进了我们的方法,并提出了一种快-慢双智能体 DRL 算法。在这种方法中,两个智能体分别处理定价和库存,并在不同的时间尺度上进行更新。来自单产品和多产品场景的数值结果验证了我们方法的有效性。

关键词

引用

@article{arxiv.2410.21109,
  title  = {Dual-Agent Deep Reinforcement Learning for Dynamic Pricing and Replenishment},
  author = {Yi Zheng and Zehao Li and Peng Jiang and Yijie Peng},
  journal= {arXiv preprint arXiv:2410.21109},
  year   = {2024}
}