基于混合学习的跨多域标签视频时刻检索
计算机视觉与模式识别
2024-06-05 v1
摘要
视频时刻检索(VMR)旨在根据给定的文本查询描述(句子),在未裁剪的原始视频中搜索视觉时间时刻。现有研究要么从收集目标时刻时间边界的详尽逐帧标注开始(全监督),要么仅使用视频级的视频-文本配对标签进行学习(弱监督)。前者由于高昂的标注成本导致数据集规模和多样性受限,对未知概念和/或新场景的泛化能力较差;后者则因标签不完整而受到视觉-文本错误关联的影响。在这项工作中,我们引入了一种称为混合学习视频时刻检索的新方法,通过在完全监督的源域和弱标签的目标域不共享公共标签空间时,将源域学习到的视频-文本匹配关系进行调整以实现知识迁移,从而解决该问题。我们的目标是探索两个域之间共享的通用知识,以改进弱标签目标域中的模型学习。具体而言,我们引入了多分支视频-文本对齐模型(EVA),该模型执行跨模态(视觉-文本)匹配信息共享和多模态特征对齐,以优化域不变的视觉和文本特征以及特定任务的判别性联合视频-文本表示。实验表明,EVA 在探索源域的时间片段标注以帮助学习目标域中无时间标签的视频时刻检索方面是有效的。
引用
@article{arxiv.2406.01791,
title = {Hybrid-Learning Video Moment Retrieval across Multi-Domain Labels},
author = {Weitong Cai and Jiabo Huang and Shaogang Gong},
journal= {arXiv preprint arXiv:2406.01791},
year = {2024}
}
备注
Accepted by BMVC2022