PI-QT-Opt:预测信息改进大规模多任务机器人强化学习
机器人学
2022-11-28 v2 人工智能
信息论
机器学习
math.IT
摘要
预测信息,即过去与未来的互信息,已被证明是训练强化学习智能体的一种有用表征学习辅助损失,因为对许多控制任务而言,建模接下来会发生什么的能力是成功的关键。虽然现有研究大多局限于在仿真中于单任务设定下训练专用智能体,但在本工作中,我们研究为机器人智能体建模预测信息,以及它对于从大量数据中掌握大量多样技能的通用电智能体的重要性。具体而言,我们引入预测信息 QT-Opt(PI-QT-Opt),这是一种增强了辅助损失的 QT-Opt 智能体,该损失学习预测信息的表征,以单一参数集在仿真和真实世界中解决多达 297 个基于视觉的机器人操作任务。我们证明,对预测信息建模显著提高了训练任务上的成功率,并带来对未见新任务的更好零样本迁移。最后,我们在真实机器人上评估 PI-QT-Opt,在多种不同环境、技能和多任务设定的实验中,相对 QT-Opt 取得实质且一致的改进。
引用
@article{arxiv.2210.08217,
title = {PI-QT-Opt: Predictive Information Improves Multi-Task Robotic Reinforcement Learning at Scale},
author = {Kuang-Huei Lee and Ted Xiao and Adrian Li and Paul Wohlhart and Ian Fischer and Yao Lu},
journal= {arXiv preprint arXiv:2210.08217},
year = {2022}
}
备注
CoRL 2022. 21 pages, 9 figures. The supplementary video is available at https://kuanghuei.github.io/piqtopt