中文

离信念学习

人工智能 2021-08-19 v5 机器学习

摘要

Dec-POMDP 的标准问题设定是自我博弈(self-play),其目标是找到一组共同最优的策略。通过自我博弈学到的策略可能采用任意约定,并隐式依赖基于对其他智能体行为的脆弱假设的多步推理,从而在测试时与人类或独立训练的智能体配对时失败。为此,我们提出离信念学习(OBL)。在每个时间步,OBL 智能体遵循策略 π1\pi_1,该策略在优化时假设过往动作由给定固定策略(π0\pi_0)采取,但假设未来动作将由 π1\pi_1 采取。当 π0\pi_0 为均匀随机时,OBL 收敛到不依赖基于其他智能体行为的推断的最优策略(最优接地策略)。OBL 可在层级中迭代,其中某一层的最优策略成为下一层的输入,从而以受控方式引入多级认知推理。与可能收敛到任意均衡策略的现有方法不同,OBL 收敛到唯一策略,使其适用于零样本协调(ZSC)。OBL 可通过虚构转移机制扩展到高维设定,并在玩具设定及基准人机与 ZSC 问题 Hanabi 中表现出强劲性能。

关键词

引用

@article{arxiv.2103.04000,
  title  = {Off-Belief Learning},
  author = {Hengyuan Hu and Adam Lerer and Brandon Cui and David Wu and Luis Pineda and Noam Brown and Jakob Foerster},
  journal= {arXiv preprint arXiv:2103.04000},
  year   = {2021}
}