面向多目标强化学习的目标感知交叉熵
机器学习
2021-10-27 v2 人工智能
机器人学
摘要
在没有关于目标的先验知识的多目标环境中学习需要大量样本且难以泛化。为解决该问题,能够通过语义理解区分目标至关重要。本文中,我们提出目标感知交叉熵(GACE)损失,其可利用自动标注的目标状态结合强化学习以自监督方式使用。基于该损失,我们进而设计了目标判别注意力网络(GDAN),其利用目标相关信息聚焦于给定指令。我们在具有多目标环境的视觉导航和机械臂操作任务上评估所提方法,并显示 GDAN 在任务成功率、样本效率和泛化方面优于最先进的方法。此外,定性分析表明,我们的所提方法可帮助智能体清晰意识到并聚焦于给定指令,促进目标导向行为。
引用
@article{arxiv.2110.12985,
title = {Goal-Aware Cross-Entropy for Multi-Target Reinforcement Learning},
author = {Kibeom Kim and Min Whoo Lee and Yoonsung Kim and Je-Hwan Ryu and Minsu Lee and Byoung-Tak Zhang},
journal= {arXiv preprint arXiv:2110.12985},
year = {2021}
}
备注
NeurIPS 2021 accepted, 19 pages including appendix and reference, 8 figures