中文

利用信息正则化学习共享与隐藏意图

人工智能 2019-01-03 v2 信息论 机器学习 多智能体系统 math.IT 机器学习

摘要

学习与合作者协作并与竞争者对抗是多智能体强化学习的关键组成部分。通常为此需要访问其他智能体(们)的模型或与之交互。本文展示了如何在无此类模型或交互的非对称信息博弈中学习协作与竞争的有效策略。我们的方法是利用信息论正则化器鼓励智能体揭示或隐藏其意图。我们同时考虑给定状态下目标与动作之间的互信息,以及目标与状态之间的互信息。我们展示了如何优化这些正则化器,使其易于与策略梯度强化学习相集成。最后,我们证明了在两个简单的非对称信息博弈中,用我们的方法学到的协作(竞争)策略可为第二智能体带来更多(更少)奖励。

关键词

引用

@article{arxiv.1808.02093,
  title  = {Learning to Share and Hide Intentions using Information Regularization},
  author = {DJ Strouse and Max Kleiman-Weiner and Josh Tenenbaum and Matt Botvinick and David Schwab},
  journal= {arXiv preprint arXiv:1808.02093},
  year   = {2019}
}

备注

Presented at the 32nd Conference on Neural Information Processing Systems (NIPS 2018)