中文

EgoInteract:用于交互理解与预测的合成第一人称视角视频生成

计算机视觉与模式识别 2026-05-25 v2

摘要

收集具有密集空间和时间标注的大规模第一人称视角视频数据集成本高昂、过程缓慢,且通常受到环境偏差、隐私限制和交互模式覆盖有限的制约。尽管合成数据在多个视觉领域展现出强大潜力,但其用于第一人称感知的研究仍相对不足,特别是对于需要时间连贯的人-物交互的任务。在这项工作中,我们引入了 EgoInteract,这是一个用于第一人称视角视频生成的可控模拟器,旨在对细粒度的第一人称交互及其时间动态进行建模。该模拟器能够对跨不同环境的相机、人体和手部运动、物体操作以及场景组成进行精确控制。在此框架的基础上,我们生成了一个带有密集空间和时间标注的合成第一人称视角视频数据集,用于时间动作分割、下一主动物体检测、交互预测以及手-物交互检测。我们在跨越不同环境、物体类别和交互模式的多个真实世界第一人称视角基准上,评估了使用模拟数据训练的模型。结果表明,在各项任务和数据集上均比强基线取得了一致的改进,证明了我们基于模拟的方法的有效性和可迁移性。

关键词

引用

@article{arxiv.2605.18214,
  title  = {EgoInteract: Synthetic Egocentric Videos Generation for Interaction Understanding and Anticipation},
  author = {Rosario Leonardi and Francesco Ragusa and Daniele Materia and Alessandro Passanisi and James Fort and Jakob Engel and Giovanni Maria Farinella},
  journal= {arXiv preprint arXiv:2605.18214},
  year   = {2026}
}