中文

当学习不可及,重置:自主视觉运动强化学习中的泛化

计算机视觉与模式识别 2023-03-31 v1 机器人学

摘要

情节式训练,即智能体的环境在每次成功或失败后重置,是训练具身强化学习(RL)智能体事实上的标准。其底层假设环境可轻易重置,这在实际中是受限的——因为重置在真实世界通常需要人力,在仿真中也可能计算昂贵;在理念上也是受限的——因为我们期望智能体能无干预地持续学习。无重置学习(即无重置 RL(RF-RL))的工作有前景但受不可逆转移(如物体破损)问题困扰,后者使学习停滞。此外,RF-RL 期间遇到的有限状态多样性与器械设置意味着研究 RF-RL 的工作大体不要求其模型泛化到新环境。在本工作中,我们转而寻求最小化而非完全消除重置,同时构建能有意义泛化的视觉智能体。由于研究泛化此前并非为 RF-RL 设计基准的焦点,我们提出新的 Stretch Pick-and-Place 基准,用于评估跨目标、外观变异与结构变化的泛化。此外,为构建性能良好的最小化重置 RL 智能体,我们提出无监督指标以检测不可逆转移,以及单策略训练机制以实现泛化。我们提出的方法显著优于先前的情节式、无重置与最小化重置方法,在 Stretch-P&P 与另一流行 RF-RL 基准中以更少重置取得更高成功率。最后,我们发现所提方法能大幅减少训练其他具身任务所需重置数,特别是在 RoboTHOR ObjectNav 中,我们使用少 99.97% 的重置取得了比情节式方法更高的成功率。

关键词

引用

@article{arxiv.2303.17600,
  title  = {When Learning Is Out of Reach, Reset: Generalization in Autonomous Visuomotor Reinforcement Learning},
  author = {Zichen Zhang and Luca Weihs},
  journal= {arXiv preprint arXiv:2303.17600},
  year   = {2023}
}