TAVIS:基于仿照学习的以动感视觉为中心的 anticipatory 注视基准
机器人学
2026-05-11 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
主动视觉——即策略在操作期间控制自身视野——已成为仿照学习的关键能力,过去一年中已有多个独立系统表明其优势。然而尚无共享基准用于比较方法或量化主动视觉贡献、哪些任务类型受益以及在何种条件下受益。我们引入 TAVIS,仿照学习的主动视觉评估基础设施,包含两个互补任务套件——TAVIS-Head(5 个任务,通过 pan/tilt 颈部实现全局搜索)和 TAVIS-Hands(3 个任务,通过腕部摄像头实现局部遮挡),基于两个人oid 躯干实现(GR1T2、Reachy2),构建于 IsaacLab 上。TAVIS 提供三种评估原语:针对相同演示的 headcam-vs-fixedcam 配对协议;GALT(Gaze-Action Lead Time),一种基于认知科学和 HRI 的新指标,用于量化学习策略中的 anticipatory 注视;以及程序 ID/OOD 分割。基于扩散策略和 的基线实验显示:(i) 主动视觉通常有帮助,但帮助程度取决于任务;(ii) 多任务策略在受控分布偏移下在两个套件上均显著下降;(iii) 仿照学习可产生 anticipatory 注视,其中位数 lead 时间与人类 teleoperator 参考相当。代码、评估脚本、演示(LeRobot v3.0;约2200个 episode)及训练好的基线已在 https://github.com/spiglerg/tavis 和 https://huggingface.co/tavis-benchmark 提供。
引用
@article{arxiv.2605.07943,
title = {TAVIS: A Benchmark for Egocentric Active Vision and Anticipatory Gaze in Imitation Learning},
author = {Giacomo Spigler},
journal= {arXiv preprint arXiv:2605.07943},
year = {2026}
}