第一人称模拟3D环境中稀疏奖励物体交互任务的强化学习
机器学习
2023-01-31 v2 人工智能
摘要
在AI2Thor虚拟家庭环境等高保真3D模拟环境中的第一人称物体交互任务,对从稀疏任务奖励中学习的强化学习(RL)智能体提出了显著的样本效率挑战。为缓解这些挑战,先前工作通过结合奖励塑形、真实物体信息和专家演示提供了广泛监督。在本工作中,我们表明,可以通过在以物体为中心的关系RL智能体进行任务学习时,将注意力物体模型作为辅助任务学习,从而在无需监督的情况下从零学习物体交互任务。我们的核心见解是:学习一个将物体注意力纳入前向预测的的物体模型,为物体及其关系的无监督表示学习提供了密集学习信号。这进而实现了以物体为中心的关系RL智能体更快的策略学习。我们通过在AI2Thor环境中引入一组具有挑战性的物体交互任务来展示我们的智能体,其中使用我们的注意力物体模型的学习是取得优异性能的关键。具体而言,我们将我们的智能体及带替代辅助任务的关系RL智能体与配备真实物体信息的关系RL智能体进行比较,表明使用我们的物体模型学习在学习速度与最大成功率两方面最好地缩小了性能差距。此外,我们发现将物体注意力纳入物体模型的前向预测对于学习捕捉物体类别与物体状态的表示至关重要。
引用
@article{arxiv.2010.15195,
title = {Reinforcement Learning for Sparse-Reward Object-Interaction Tasks in a First-person Simulated 3D Environment},
author = {Wilka Carvalho and Anthony Liang and Kimin Lee and Sungryull Sohn and Honglak Lee and Richard L. Lewis and Satinder Singh},
journal= {arXiv preprint arXiv:2010.15195},
year = {2023}
}
备注
Accepted to IJCAI 2021