中文

MVMR:一种针对多干扰项视频时刻检索忠实性评估的新框架

计算机视觉与模式识别 2024-08-12 v4 人工智能 计算与语言

摘要

随着多媒体内容的爆发,视频时刻检索(VMR)旨在从视频中检测与给定文本查询匹配的视频时刻,已成为一个关键问题并得到深入研究。然而,现有VMR框架假设给定一段视频来评估视频时刻检索性能,这可能无法揭示模型对错误给定视频是否表现出过度自信。本文提出MVMR(用于忠实性评估的大规模视频时刻检索)任务,旨在从包含多个干扰项的大规模视频集中检索视频时刻,以评估VMR模型的忠实性。针对该任务,我们提出一种自动化大规模视频池构建框架,利用文本与视觉语义距离验证方法对负样本(干扰项)与正样本(假负样本)视频集进行分类。我们使用这些方法扩展现有VMR数据集,并新构建了三个实用的MVMR数据集。为解决该任务,我们进一步提出一种强信息样本加权学习方法CroCs,其采用两种对比学习机制:(1)弱监督潜在负样本学习;(2)跨方向难负样本学习。在MVMR数据集上的实验结果表明,现有VMR模型易被错误信息(干扰项)分散注意力,而我们的模型表现出显著鲁棒的性能,证明CroCs对于区分正样本时刻与干扰项至关重要。我们的代码与数据集公开可用:https://github.com/yny0506/Massive-Videos-Moment-Retrieval。

关键词

引用

@article{arxiv.2309.16701,
  title  = {MVMR: A New Framework for Evaluating Faithfulness of Video Moment Retrieval against Multiple Distractors},
  author = {Nakyeong Yang and Minsung Kim and Seunghyun Yoon and Joongbo Shin and Kyomin Jung},
  journal= {arXiv preprint arXiv:2309.16701},
  year   = {2024}
}

备注

accepted to CIKM 2024