中文

深度强化学习智能体是否对意图进行建模?

人工智能 2018-05-22 v2

摘要

推断其他智能体的心理状态(如知识、信念和意图)被认为对于与其他智能体的有效交互至关重要。最近,通过深度强化学习训练的多智能体系统已被证明能够成功解决不同任务,但每个智能体如何对其环境中的其他智能体进行建模或表示仍不清楚。在这项工作中,我们测试深度强化学习智能体是否在一项任务中显式表示其他智能体的意图(其特定目标或目的),该任务要求智能体在 2D 环境中协调覆盖不同位置。特别地,我们随时间跟踪一个线性解码器的性能,该解码器从每个智能体神经网络控制器的隐藏状态预测所有智能体的最终目标。我们观察到智能体的隐藏层表示了关于其他智能体目标(即它们最终覆盖的目标地标)的显式信息。我们还进行了一系列实验,将某些智能体替换为具有固定目标的其他智能体,以测试训练智能体的泛化水平。我们注意到在训练阶段智能体对每个目标发展出差异化偏好,这阻碍了泛化。为缓解上述问题,我们提出对 MADDPG 训练算法的简单修改,从而针对未见过的智能体实现更好的泛化。我们认为,促进更主动的意图读取机制的训练协议,例如通过阻止简单的对称性破缺解,是实现在不同合作与竞争任务中更鲁棒泛化的有前景方向。

关键词

引用

@article{arxiv.1805.06020,
  title  = {Do deep reinforcement learning agents model intentions?},
  author = {Tambet Matiisen and Aqeel Labash and Daniel Majoral and Jaan Aru and Raul Vicente},
  journal= {arXiv preprint arXiv:1805.06020},
  year   = {2018}
}