中文

GroundNLQ @ Ego4D自然语言查询挑战赛2023

计算机视觉与模式识别 2023-06-28 v1 计算与语言

摘要

在本报告中,我们展示了在CVPR 2023的Ego4D自然语言查询(NLQ)挑战赛中的冠军方案。本质上,要在视频中准确定位,需要一个有效的第一人称特征提取器和一个强大的定位模型。受此启发,我们利用两阶段预训练策略在视频解说上训练第一人称特征提取器和定位模型,并进一步在标注数据上微调模型。此外,我们提出一种新颖的定位模型GroundNLQ,其采用多模态多尺度定位模块以实现有效的视频与文本融合及不同时间区间(尤其是长视频)的处理。在盲测集上,GroundNLQ在R1@IoU=0.3和R1@IoU=0.5分别取得25.67和18.18,并以明显优势超越所有其他队伍。我们的代码将发布于\url{https://github.com/houzhijian/GroundNLQ}。

关键词

引用

@article{arxiv.2306.15255,
  title  = {GroundNLQ @ Ego4D Natural Language Queries Challenge 2023},
  author = {Zhijian Hou and Lei Ji and Difei Gao and Wanjun Zhong and Kun Yan and Chao Li and Wing-Kwong Chan and Chong-Wah Ngo and Nan Duan and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2306.15255},
  year   = {2023}
}

备注

5 pages, 2 figures, 4 tables, the champion solution for Ego4D Natural Language Queries Challenge in CVPR 2023