面向视频文本检索的统一粗到细对齐方法
计算机视觉与模式识别
2023-09-20 v1 人工智能
计算与语言
机器学习
摘要
视频文本检索的典型方法利用视觉与文本信息之间的粗粒度或细粒度对齐。然而,根据文本查询检索正确视频通常具有挑战性,因为这需要能够推理高层(场景)与低层(物体)视觉线索以及它们与文本查询的关联。为此,我们提出一种统一粗到细对齐模型,称为 UCoFiA。具体而言,我们的模型在不同粒度级别上捕获跨模态相似度信息。为缓解无关视觉线索的影响,我们还应用交互式相似度聚合模块 (ISA),在聚合跨模态相似度以获得各粒度的相似度分数时考虑不同视觉特征的重要性。最后,我们应用 Sinkhorn-Knopp 算法对各层级的相似度进行归一化后再求和,缓解不同层级中表征过度与不足的问题。通过联合考虑不同粒度的跨模态相似度,UCoFiA 实现了多粒度对齐的有效统一。在经验上,UCoFiA 在多个视频文本检索基准上优于先前基于 CLIP 的 SOTA 方法,在 MSR-VTT、Activity-Net 和 DiDeMo 上的文本到视频检索 R@1 分别提升 2.4%、1.4% 和 1.3%。我们的代码公开于 https://github.com/Ziyang412/UCoFiA。
引用
@article{arxiv.2309.10091,
title = {Unified Coarse-to-Fine Alignment for Video-Text Retrieval},
author = {Ziyang Wang and Yi-Lin Sung and Feng Cheng and Gedas Bertasius and Mohit Bansal},
journal= {arXiv preprint arXiv:2309.10091},
year = {2023}
}
备注
ICCV 2023