GridToPix:以最小监督训练具身智能体
计算机视觉与模式识别
2021-10-14 v2 人工智能
机器学习
多智能体系统
摘要
尽管深度强化学习(RL)承诺摆脱人工标注数据,但其巨大成功——尤其在具身人工智能(Embodied AI)中——需要通过精心设计的塑形奖励来创建监督。事实上,若无塑形奖励,即仅使用终止奖励,当前Embodied AI的结果在各类问题上显著退化:从单智能体基于Habitat的PointGoal导航(SPL从55降至0)、双智能体基于AI2-THOR的家具搬运(成功率从58%降至1%),到三智能体基于Google Football的3对1含守门员(比赛得分从0.6降至0.1)。由于从塑形奖励训练无法扩展到更现实的任务,社区需要提升仅用终止奖励训练的成功率。为此我们提出GridToPix:1)在通用镜像Embodied AI环境的网格世界(即与任务无关)中用终止奖励训练智能体;2)将学到的策略蒸馏到位于复杂视觉世界中的智能体。尽管使用相同的模型和RL算法且仅从终止奖励学习,GridToPix在各项任务上显著提升结果:从PointGoal导航(SPL从0提升至64)、家具搬运(成功率从1%提升至25%)到足球博弈(比赛得分从0.1提升至0.6)。GridToPix甚至有助于改善塑形奖励训练的结果。
引用
@article{arxiv.2105.00931,
title = {GridToPix: Training Embodied Agents with Minimal Supervision},
author = {Unnat Jain and Iou-Jen Liu and Svetlana Lazebnik and Aniruddha Kembhavi and Luca Weihs and Alexander Schwing},
journal= {arXiv preprint arXiv:2105.00931},
year = {2021}
}
备注
Project page: https://unnat.github.io/gridtopix/ ; last two authors contributed equally