中文

VLANet: 用于弱监督视频时刻检索的视频-语言对齐网络

计算机视觉与模式识别 2023-10-10 v1

摘要

视频时刻检索(VMR)是一项在未裁剪视频中由自然语言查询定位时间时刻的任务。针对VMR,已有若干需要全监督训练的方法被提出。不幸的是,获取大量带有各查询时间边界标注的训练视频是一个劳动密集型过程。本文探索以弱监督方式(wVMR)执行VMR的方法:训练仅使用描述视频片段的文本查询,而无时间时刻标注。现有wVMR方法生成多尺度候选片段并应用查询引导注意力机制以突出最相关候选。为利用弱监督,采用对比学习为正确视频-查询对预测比错误对更高的分数。已观察到,大量候选片段、粗糙的查询表示以及单向注意力机制导致模糊的注意力图,限制了定位性能。为解决此问题,提出视频-语言对齐网络(VLANet),其通过剪枝虚假候选片段并应用具有细粒度查询表示的多向注意力机制来学习更锐利的注意力。代理候选选择模块基于在联合嵌入空间中与查询的邻近度选择候选片段,从而大幅减少候选片段,带来更低计算负载与更锐利注意力。接着,级联跨模态注意力模块考虑稠密特征交互与多向注意力流以学习多模态对齐。VLANet使用对比损失端到端训练,迫使语义相似的视频与查询聚集。实验表明,该方法在Charades-STA与DiDeMo数据集上取得了最先进(SOTA)性能。

关键词

引用

@article{arxiv.2008.10238,
  title  = {VLANet: Video-Language Alignment Network for Weakly-Supervised Video Moment Retrieval},
  author = {Minuk Ma and Sunjae Yoon and Junyeong Kim and Youngjoon Lee and Sunghun Kang and Chang D. Yoo},
  journal= {arXiv preprint arXiv:2008.10238},
  year   = {2023}
}

备注

16 pages, 6 figures, European Conference on Computer Vision, 2020