基于多主体强化学习的动态定价:平衡盈利性、稳定性与公平性
机器学习
2026-03-19 v1 人工智能
摘要
在竞争性零售市场中,动态定价需要适应需求波动和竞争者行为变化的策略。本文系统性地评估了多主体强化学习(MARL)方法— Specifically MAPPO 和 MADDPG—用于在竞争情境下的动态价格优化。我们构建了一个源自真实零售数据的仿真市场环境,对这些算法与独立 DDPG(IDDPG)基线进行基准测试。我们评估盈利性能、随机种子下的稳定性、公平性以及训练效率。我们的结果显示,MAPPO 在所有情况下均实现最高的平均回报并具有低方差,为竞争性价格优化提供了稳定可重现的方法,而 MADDPG 虽实现略低的利润,但在各主体之间实现了最公平的利润分配。这些发现表明,MARL 方法—尤其是 MAPPO—为动态零售定价提供了一个可扩展且稳定的独立学习方法的替代方案。
引用
@article{arxiv.2603.16888,
title = {Multi-Agent Reinforcement Learning for Dynamic Pricing: Balancing Profitability,Stability and Fairness},
author = {Krishna Kumar Neelakanta Pillai Santha Kumari Amma},
journal= {arXiv preprint arXiv:2603.16888},
year = {2026}
}