中文

基于 VLM 的 AutoFocus-IL:无需额外人类标注的数据高效视觉仿真学习

机器人学 2025-11-26 v2 计算机视觉与模式识别

摘要

AutoFocus-IL 是一种简洁而有效的方法,通过引导策略关注任务相关特征而非干扰项和伪相关,从而提高视觉仿真学习的数据效率和泛化能力。虽然saliency正则化已被证明是实现这一目标的有前景的方法,但现有方法通常需要人类注视数据或手动saliency标注等高成本的监督。相反,AutoFocus-IL 利用视觉语言模型(VLM)自动识别并跟踪演示中的关键对象,生成强化注意力与任务相关线索之间对齐的时序saliency图。实验在CARLA模拟器和真实机器人操作任务中表明,AutoFocus-IL 不仅超越标准行为克隆方法,还优于假设拥有人类监督(如注视数据)的前沿基线方法。代码、数据集和训练好的策略视频可在 https://AutoFocus-IL.github.io/ 查看。

关键词

引用

@article{arxiv.2511.18617,
  title  = {AutoFocus-IL: VLM-based Saliency Maps for Data-Efficient Visual Imitation Learning without Extra Human Annotations},
  author = {Litian Gong and Fatemeh Bahrani and Yutai Zhou and Amin Banayeeanzade and Jiachen Li and Erdem Bıyık},
  journal= {arXiv preprint arXiv:2511.18617},
  year   = {2025}
}

备注

8 pages, 6 figures. Code and datasets available at http://autofocus-il.github.io/