多查询视频检索
计算机视觉与模式识别
2022-07-22 v2
摘要
基于文本描述检索目标视频是一项具有重大实用价值的任务,近年来受到越来越多的关注。尽管取得了近期进展,现有视频检索数据集中不完善的标注给模型评估与开发带来了显著挑战。在本文中,我们聚焦于研究较少的多查询视频检索设定来解决此问题,其中向模型提供多个描述以在视频档案中搜索。我们首先表明,多查询检索任务有效缓解了由不完善标注引入的数据集噪声,并与人类对当前模型检索能力的判断更好地相关。然后我们研究了几种在训练时利用多查询的方法,并证明受多查询启发的训练可带来更优性能与更好的泛化能力。我们希望该方向的进一步研究能为构建在真实世界视频检索应用中表现更好的系统提供新见解。
引用
@article{arxiv.2201.03639,
title = {Multi-Query Video Retrieval},
author = {Zeyu Wang and Yu Wu and Karthik Narasimhan and Olga Russakovsky},
journal= {arXiv preprint arXiv:2201.03639},
year = {2022}
}
备注
ECCV 2022