利用模态标签提升跨模态视频检索
计算机视觉与模式识别
2025-09-03 v3
摘要
视频检索需要将视觉内容与相应的自然语言描述对齐。本文引入了模态辅助概念用于视频检索(Modality Auxiliary Concepts for Video Retrieval, MAC-VR),一种新方法,利用来自基础模型自动提取的模态特定标签来增强视频检索。我们提出在潜在空间中对模态进行对齐,同时学习和对齐来自视频及其对应标题特征派生的辅助潜在概念。我们引入这些辅助概念以提高视觉和文本潜在概念的对齐程度,使概念能够彼此区分。我们在六个多样化数据集上进行了广泛实验:两个不同划分的 MSR-VTT、DiDeMo、TGIF、Charades 和 YouCook2。实验结果一致显示,模态特定标签改善了跨模态对齐,在三个数据集上超越当前最先进方法,在其他数据集上表现相当或更好。项目网页:https://adrianofragomeni.github.io/MAC-VR/
引用
@article{arxiv.2504.01591,
title = {Leveraging Modality Tags for Enhanced Cross-Modal Video Retrieval},
author = {Adriano Fragomeni and Dima Damen and Michael Wray},
journal= {arXiv preprint arXiv:2504.01591},
year = {2025}
}
备注
Accepted at BMVC 2025