中文

损失厌恶促进独立强化学习者的协调

人工智能 2020-01-01 v1

摘要

我们研究哪些因素能够加速独立自私学习智能体之间协作行为的涌现。我们从一个名为“前任之战”(BoE)的空间重复博弈出发,该博弈已获得人类行为数据(由 Hawkings 和 Goldstone 于 2016 年获取),我们发现它很有趣,因为它考虑了两种情况:一种称为弹道式的经典博弈论版本,其中智能体只能做出一个动作/决策(等同于性别之战),以及一种称为动态式的空间版本,其中智能体可以改变决策(空间连续版本)。我们用独立强化学习智能体对两种版本的博弈进行建模,并操控奖励函数,引入“损失厌恶”将其转化为效用:相较于对方所得,智能体获得的奖励可能被视为价值更低。我们通过实验证明,引入损失厌恶通过加速合作的出现并在某些情况下(如动态条件中)使其成为可能,从而促进了合作。我们认为这可能是解释 Hawkings 和 Goldstone 实验中报道的人类行为快速趋向协作的重要因素。

关键词

引用

@article{arxiv.1912.12633,
  title  = {Loss aversion fosters coordination among independent reinforcement learners},
  author = {Marco Jerome Gasparrini and Martí Sánchez-Fibla},
  journal= {arXiv preprint arXiv:1912.12633},
  year   = {2020}
}

备注

5 pages, 2 figures, appeared in CCIA 2018