中文

利用相关性感知在线挖掘学习视频检索模型

计算机视觉与模式识别 2022-03-17 v1

摘要

由于每小时上传的视频及相关字幕数量巨大,基于深度学习的跨模态视频检索解决方案正吸引越来越多关注。一种典型方法在于学习一个联合的文本-视频嵌入空间,其中视频与其关联字幕的相似度被最大化,而与所有其他字幕(称为负样本)的相似度被强制降低。该方法假设数据集中仅视频与字幕对是有效的,但不同字幕——正样本——也可能描述其视觉内容,因此其中一些会被错误地惩罚。为解决此缺陷,我们提出相关性感知负样本与正样本挖掘(RANP),其基于负样本的语义改进其选择,同时提升其他有效正样本的相似度。我们探讨了这些技术在两个视频-文本数据集 EPIC-Kitchens-100 和 MSR-VTT 上的影响。通过使用所提技术,我们在 nDCG 和 mAP 方面取得显著改进,达到了最先进结果,例如在 EPIC-Kitchens-100 上 +5.3% nDCG 和 +3.0% mAP。我们在 \url{https://github.com/aranciokov/ranp} 分享了代码与预训练模型。

关键词

引用

@article{arxiv.2203.08688,
  title  = {Learning video retrieval models with relevance-aware online mining},
  author = {Alex Falcon and Giuseppe Serra and Oswald Lanz},
  journal= {arXiv preprint arXiv:2203.08688},
  year   = {2022}
}

备注

Accepted at 21st International Conference on Image Analysis and Processing (ICIAP 2021)