中文

第一人称视频中的细粒度时空定位

计算机视觉与模式识别 2025-12-10 v2 计算与语言

摘要

时空视频定位旨在根据文本查询在视频中定位目标实体。尽管现有研究在第三人称视频(exocentric videos)上已取得显著进展,但第一人称设定(egocentric setting)仍相对未被充分探索,尽管其在增强现实和机器人等应用中日益重要。本研究对第一人称与第三人称视频之间的差异进行了系统分析,揭示了若干关键挑战,包括目标持续时间更短、轨迹更稀疏、目标尺寸更小以及位置偏移更大。为应对这些挑战,我们提出了 EgoMask,这是首个面向第一人称视频细粒度时空定位的像素级基准。该基准基于我们所提出的自动标注流程构建,可在短期、中期和长期视频上标注指代表达式和目标掩码。此外,我们还构建了大规模训练数据集 EgoMask-Train,以促进模型开发。实验表明,当前最先进的时空定位模型在我们的 EgoMask 基准上表现较差,但在 EgoMask-Train 上进行微调可带来显著提升,同时保持在第三人称数据集上的性能。本工作为推进第一人称视频理解提供了关键资源和洞察。代码已开源,地址为 https://github.com/LaVi-Lab/EgoMask 。

关键词

引用

@article{arxiv.2508.00518,
  title  = {Fine-grained Spatiotemporal Grounding on Egocentric Videos},
  author = {Shuo Liang and Yiwu Zhong and Zi-Yuan Hu and Yeyao Tao and Liwei Wang},
  journal= {arXiv preprint arXiv:2508.00518},
  year   = {2025}
}

备注

Accepted by ICCV 2025