面向视频检索的视频编辑
计算机视觉与模式识别
2024-09-10 v2 信息检索
摘要
尽管预训练视觉-语言模型在提升大规模网络视频的视频文本检索性能方面展现了显著优势,但微调仍然发挥着关键作用,这需要带有起始和结束时间的人工标注片段,耗费大量人力。为了解决这一问题,我们探索了一种成本更低的标注替代来源,即单一时间戳,用于视频文本检索。我们以启发式方式从时间戳初始化片段以预热检索模型。随后,提出了一种视频片段编辑方法来细化初始粗糙边界,从而提升检索性能。我们引入了师生网络用于视频片段编辑。教师模型用于编辑训练集中的片段,而学生模型在编辑后的片段上进行训练。在学生模型性能提升后,教师模型的权重由学生模型的权重更新。我们的方法与模型无关,适用于任何检索模型。我们基于三种SOTA检索模型COOT、VideoCLIP和CLIP4Clip进行了实验。在YouCook2、DiDeMo和ActivityNet-Captions三个视频检索数据集上的实验表明,在所有三种检索模型中,我们编辑后的片段相较于初始片段持续提升了检索性能。
引用
@article{arxiv.2402.02335,
title = {Video Editing for Video Retrieval},
author = {Bin Zhu and Kevin Flanagan and Adriano Fragomeni and Michael Wray and Dima Damen},
journal= {arXiv preprint arXiv:2402.02335},
year = {2024}
}