用于弱监督视频时刻检索的多提案协作与多任务训练
计算机视觉与模式识别
2026-05-15 v1 多媒体
摘要
本研究聚焦于弱监督视频时刻检索(VMR),旨在仅使用视频级对应关系,在未剪辑视频中识别出与给定查询语义相似的时刻,而无需在训练期间依赖时间标注。先前的方法要么聚合视频中所有实例的预测,要么通过为查询提出重构来间接处理该任务。然而,这些方法通常会产生低质量的时间提案,难以区分同一视频中未对齐的时刻,或者由于依赖单一辅助任务而缺乏稳定性。为了解决这些局限性,我们提出了一种名为多提案协作与多任务训练(MCMT)的新型弱监督方法。首先,我们生成多个提案并从中导出相应的可学习高斯掩码。然后将这些掩码组合以创建高质量的正样本掩码,突出显示与查询最相关的视频片段。同时,我们将同一视频中的其他片段分类为简单负样本,并将整个视频分类为困难负样本。在训练期间,我们引入前向和逆向掩码查询重构任务,对网络施加更实质性的约束,以促进更鲁棒和稳定的检索性能。在两个标准基准上的大量实验证实了所提方法在 VMR 中的有效性。
引用
@article{arxiv.2605.14838,
title = {Multi-proposal Collaboration and Multi-task Training for Weakly-supervised Video Moment Retrieval},
author = {Bolin Zhang and Chao Yang and Bin Jiang and Takahiro Komamizu and Ichiro Ide},
journal= {arXiv preprint arXiv:2605.14838},
year = {2026}
}
备注
26 pages, 4 figures. Preprint version of the article published in International Journal of Machine Learning and Cybernetics