中文

面向多智能体系统的深度策略推断 Q 网络

人工智能 2018-04-10 v2

摘要

我们提出 DPIQN,一种面向由可控制智能体、合作者与对手相互交互构成的多智能体系统的深度策略推断 Q 网络(deep policy inference Q-network)。我们关注此类系统中的一个挑战性问题——对具有变化策略的智能体建模,并提议通过推断合作者与对手的策略,从原始观测(如原始图像)中学习“策略特征”。DPIQN 将学习到的策略特征作为隐藏向量纳入其自身的深度 Q 网络(DQN)中,从而能够比最先进的深度强化学习模型为可控制智能体预测更好的 Q 值。我们进一步提出 DPIQN 的增强版本,称为深度循环策略推断 Q 网络(DRPIQN),用于处理部分可观测性。DPIQN 与 DRPIQN 均通过自适应训练过程进行训练,该过程调整网络在不同训练阶段对策略特征学习及其自身 Q 值学习的注意力。我们对 DPIQN 与 DRPIQN 进行了全面分析,并突出了它们在多种多智能体设定中的有效性与泛化能力。我们的模型在一个包含竞争与协作场景的经典足球游戏中进行评估。在 1 vs. 1 和 2 vs. 2 游戏上进行的实验结果表明,DPIQN 与 DRPIQN 相较于基线 DQN 与深度循环 Q 网络(DRQN)模型表现出更优的性能。我们还探索了合作者或对手动态改变其策略的场景,并表明 DPIQN 与 DRPIQN 在稳定性与平均得分方面确实带来了更好的整体性能。

关键词

引用

@article{arxiv.1712.07893,
  title  = {A Deep Policy Inference Q-Network for Multi-Agent Systems},
  author = {Zhang-Wei Hong and Shih-Yang Su and Tzu-Yun Shann and Yi-Hsiang Chang and Chun-Yi Lee},
  journal= {arXiv preprint arXiv:1712.07893},
  year   = {2018}
}