中文

GazeNLQ @ Ego4D 自然语言查询挑战 2025

计算机视觉与模式识别 2025-06-09 v1

摘要

本报告介绍了我们对 Ego4D 自然语言查询 (NLQ) 挑战赛 (CVPR 2025) 的解决方案。第三人称视频从佩戴者的视角捕捉场景,其中凝视作为一种关键的非语言交流线索,反映了视觉注意力并提供了关于人类意图和认知的洞察。基于此,我们提出了一种新方法,GazeNLQ,通过利用凝视来检索与给定自然语言查询相匹配的视频片段。具体而言,我们引入了一种基于对比学习的预训练策略,直接从视频中进行凝视估计。对估计得到的凝视用于增强所提出模型中的视频表示,从而提高局化精度。实验结果表明,GazeNLQ 达到了 [email protected][email protected] 分别为 27.82 和 18.68。我们的代码已公开于 https://github.com/stevenlin510/GazeNLQ。

关键词

引用

@article{arxiv.2506.05782,
  title  = {GazeNLQ @ Ego4D Natural Language Queries Challenge 2025},
  author = {Wei-Cheng Lin and Chih-Ming Lien and Chen Lo and Chia-Hung Yeh},
  journal= {arXiv preprint arXiv:2506.05782},
  year   = {2025}
}