中文

蒙眼专家泛化能力更强:来自机器人操作与电子游戏的启示

机器人学 2025-10-29 v1 机器学习

摘要

行为克隆是一种简单而有效的技术,用于从演示中学习序贯决策。近年来,它作为面向物理世界的基础模型的核心而备受关注,而要在物理世界中实现泛化,需要针对大量任务的海量演示。通常,由掌握任务全部信息的人类专家演示出(近乎)最优行为。在本文中,我们提出向演示者隐藏部分任务信息。这种"蒙眼"专家被迫采用非平凡的探索来完成任务。我们证明,克隆蒙眼专家比克隆完全知情专家能够更好地泛化到未见过的任务。我们在真实世界机器人插钉任务中结合(有限的)人类演示进行了实验,同时还在 Procgen 基准的电子游戏中进行了实验。此外,我们以理论分析佐证我们的发现,证实泛化误差以 I/m\sqrt{I/m} 的尺度变化,其中 II 衡量演示者可获取的任务信息量,mm 为已演示任务数。理论与实践均表明,在演示任务较少时,克隆蒙眼专家具有更好的泛化能力。项目页面(含视频与代码):https://sites.google.com/view/blindfoldedexperts/home

关键词

引用

@article{arxiv.2510.24194,
  title  = {Blindfolded Experts Generalize Better: Insights from Robotic Manipulation and Videogames},
  author = {Ev Zisselman and Mirco Mutti and Shelly Francis-Meretzki and Elisei Shafer and Aviv Tamar},
  journal= {arXiv preprint arXiv:2510.24194},
  year   = {2025}
}