中文

用于第一人称视频的物体-镜头增强定位网络

计算机视觉与模式识别 2025-05-08 v1 人工智能

摘要

第一人称视频定位是具身智能应用中的一项关键任务,有别于第三人称视频时刻定位。现有方法主要关注第一人称与第三人称视频之间的分布差异,但往往忽略了第一人称视频的关键特征以及问题类型查询所强调的细粒度信息。为了解决这些局限性,我们提出了OSGNet,一种用于第一人称视频的物体-镜头增强定位网络。具体而言,我们从视频中提取物体信息以丰富视频表征,特别是针对在文本查询中被强调但未在视频特征中被直接捕捉到的物体。此外,我们分析了第一人称视频中固有的频繁镜头运动,利用这些特征提取佩戴者的注意力信息,从而增强模型执行模态对齐的能力。在三个数据集上进行的实验表明,OSGNet取得了SOTA性能,验证了我们方法的有效性。我们的代码可在 https://github.com/Yisen-Feng/OSGNet 找到。

关键词

引用

@article{arxiv.2505.04270,
  title  = {Object-Shot Enhanced Grounding Network for Egocentric Video},
  author = {Yisen Feng and Haoyu Zhang and Meng Liu and Weili Guan and Liqiang Nie},
  journal= {arXiv preprint arXiv:2505.04270},
  year   = {2025}
}

备注

Accepted by CVPR 2025