中文

部分可观测设定下深度强化学习的自监督辅助损失

人工智能 2021-04-20 v1 机器学习

摘要

本工作中我们探索了一种辅助损失,适用于需要高性能智能体能够导航空间环境的强化学习环境。所提辅助损失是最小化一个神经网络分类器的分类误差,该分类器预测从智能体当前回合轨迹中采样的一对状态是否有序。分类器以一对状态及智能体的记忆作为输入。该辅助损失的动机在于,智能体回合轨迹中一对状态哪一个更近,与两个状态中哪一个空间上离智能体更近,存在强相关性。我们的假设是,学习回答此问题的特征会促使智能体在记忆中学习与内化有助于空间推理的状态表示。我们在一个网格世界的导航任务上测试了该辅助损失,相较于强基线方法获得了 9.6% 的累积回合奖励提升。

关键词

引用

@article{arxiv.2104.08492,
  title  = {A Self-Supervised Auxiliary Loss for Deep RL in Partially Observable Settings},
  author = {Eltayeb Ahmed and Luisa Zintgraf and Christian A. Schroeder de Witt and Nicolas Usunier},
  journal= {arXiv preprint arXiv:2104.08492},
  year   = {2021}
}