中文

不择手段取胜——利用强化学习违反卡特尔禁令

人工智能 2021-07-06 v1 机器学习 多智能体系统

摘要

定价决策正日益由人工智能作出。得益于能够利用实时市场数据进行训练并即时决策,深度强化学习算法在此类定价决策中尤为有效。在电子商务场景中,多个强化学习智能体可基于竞争对手价格设定价格。因此,研究指出智能体长期可能陷入合谋状态。为深入分析此问题,我们构建了一个基于 modified 囚徒困境版本的场景,其中三个智能体玩石头剪刀布游戏。我们的结果表明,动作选择可分解为特定阶段,从而确立了开发合谋预防系统的可能性,此类系统能够识别可能导致竞争者间合谋的情形。我们进一步提供证据表明,智能体能够在未被显式训练的情况下执行默契合谋策略。

关键词

引用

@article{arxiv.2107.01856,
  title  = {Winning at Any Cost -- Infringing the Cartel Prohibition With Reinforcement Learning},
  author = {Michael Schlechtinger and Damaris Kosack and Heiko Paulheim and Thomas Fetzer},
  journal= {arXiv preprint arXiv:2107.01856},
  year   = {2021}
}

备注

accepted at the 19th International Conference on Practical Applications of Agents and Multi-Agent Systems (PAAMS 2021)