基于潜在相关对考虑多对多对应的文本查询视频时刻检索
计算机视觉与模式识别
2021-06-28 v1
摘要
本文致力于从视频语料库中进行基于文本的 video moment retrieval(视频时刻检索)任务。为训练模型,使用了文本-时刻配对数据集以学习正确对应。在典型训练方法中,真值文本-时刻对用作正对,而其他对视为负对。然而,除真值对外,某些文本-时刻对应也应被视为正对。此时,一个文本标注可对应多个视频时刻为正。反之,一个视频时刻可对应多个文本标注。因此,文本标注与视频时刻之间存在多对多对应。基于这些对应,我们可以形成潜在相关对,它们未被给定为真值但也不是负对;有效地将此类相关对纳入训练可提升检索性能。文本查询应描述视频时刻中正在发生的事件。因此,标注了相似文本(包含相似动作)的不同视频时刻很可能具有相似动作,从而这些对可视为潜在相关对。本文提出一种利用基于文本标注语言分析检测出的潜在相关对的新训练方法。在两个基准数据集上的实验表明,我们的方法在定量与定性上均提升了检索性能。
引用
@article{arxiv.2106.13566,
title = {Video Moment Retrieval with Text Query Considering Many-to-Many Correspondence Using Potentially Relevant Pair},
author = {Sho Maeoki and Yusuke Mukuta and Tatsuya Harada},
journal= {arXiv preprint arXiv:2106.13566},
year = {2021}
}
备注
15 pages, 10 figures