PIRLNav:基于模仿预训练与强化学习微调的 ObjectNav 方法
机器学习
2023-03-28 v2 人工智能
机器人学
摘要
我们研究 ObjectGoal Navigation(目标物体导航)——即置于新环境中的虚拟机器人被要求导航至某个物体。先前工作表明,利用人类演示数据集通过行为克隆(BC)进行模仿学习(IL)可取得有前景的结果。然而这存在局限:1)BC 策略对新状态泛化能力差,因为训练模仿的是动作而非其后果;2)收集演示代价高昂。另一方面,强化学习(RL)可轻易扩展,但需要精细的奖励工程以实现期望行为。我们提出 PIRLNav,一种先在人类演示上做 BC 预训练、再 RL 微调的两阶段学习方案。由此得到的策略在 ObjectNav 上取得 的成功率(较先前最优绝对提升 )。利用该 BCRL 训练方案,我们给出了对设计选择的严谨实证分析。首先,我们探究人类演示是否可被“免费”(自动生成)的演示源替代,例如最短路径(SP)或任务无关的前沿探索(FE)轨迹。我们发现,即便在训练集 BC 预训练成功率相同、甚至在 BC 预训练成功率偏向 SP 或 FE 策略的验证集子集上,人类演示上的 BCRL 仍优于 SP 和 FE 轨迹上的 BCRL。接着,我们研究 RL 微调性能如何随 BC 预训练数据集规模变化。我们发现,随着 BC 预训练数据集增大并达到高 BC 准确率,RL 微调带来的提升变小,且我们最佳 BCRL 策略 的性能可用不到一半数量的 BC 演示实现。最后,我们分析 ObjectNav 策略的失败模式,并给出进一步改进的指导原则。
引用
@article{arxiv.2301.07302,
title = {PIRLNav: Pretraining with Imitation and RL Finetuning for ObjectNav},
author = {Ram Ramrakhya and Dhruv Batra and Erik Wijmans and Abhishek Das},
journal= {arXiv preprint arXiv:2301.07302},
year = {2023}
}
备注
8 pages + supplement