中文

对于运动控制中的预训练视觉模型,并非所有策略学习方法都等量齐观

计算机视觉与模式识别 2023-06-21 v2 机器人学

摘要

近年来,利用预训练视觉模型进行运动控制受到越来越多的关注。现有工作主要强调这一预训练阶段的重要性,而在控制特定微调期间下游策略学习所扮演的同样重要的角色常被忽视。因此,预训练视觉模型在不同控制策略下的有效性是否一致仍不清楚。为弥补这一认知空白,我们对14个预训练视觉模型使用3类不同的策略学习方法进行了综合研究,包括强化学习(RL)、通过行为克隆(BC)的模仿学习,以及带视觉奖励函数(VRF)的模仿学习。我们的研究产生了一系列有趣的结果,包括发现预训练的有效性高度依赖于下游策略学习算法的选择。我们表明,传统上基于RL方法的评估具有高度变异性因而不可靠,并进一步主张使用更鲁棒的方法如VRF和BC。为便于未来对预训练模型及其策略学习方法进行更通用的评估,我们还随工作发布了一个跨3种不同环境的21个任务的基准。

关键词

引用

@article{arxiv.2304.04591,
  title  = {For Pre-Trained Vision Models in Motor Control, Not All Policy Learning Methods are Created Equal},
  author = {Yingdong Hu and Renhao Wang and Li Erran Li and Yang Gao},
  journal= {arXiv preprint arXiv:2304.04591},
  year   = {2023}
}