中文

一种用于视频-语言定位的多级对齐训练方案

计算机视觉与模式识别 2023-02-28 v3 计算与语言 机器学习

摘要

为解决视频-语言定位任务,关键在于网络理解两种模态之间的关联。对于一对视频与语言描述,其语义关系由它们编码的相似性反映。一个好的多模态编码器应能很好地捕捉两种输入的语义,并在共享特征空间中编码它们,使嵌入距离恰当地转化为其语义相似性。在本工作中,我们聚焦于视频与语言之间的这一语义关联,并提出了一种多级对齐训练方案来直接塑造编码过程。基于从高层上下文到细粒度语义的信息相似性,设计了视频-语言对齐对的全局与片段级别。使用对比损失来对比正、负对齐对之间编码的相似性,并确保网络以如下方式训练:相似信息在共享特征空间中被紧密编码,而不同语义的信息被分开。我们的多级对齐训练可应用于多种视频-语言定位任务。结合任务特定训练损失,我们的框架在多个视频问答与检索数据集上取得了与先前最优方法相当的性能。

关键词

引用

@article{arxiv.2204.10938,
  title  = {A Multi-level Alignment Training Scheme for Video-and-Language Grounding},
  author = {Yubo Zhang and Feiyang Niu and Qing Ping and Govind Thattai},
  journal= {arXiv preprint arXiv:2204.10938},
  year   = {2023}
}

备注

Accepted at ICDM 2022 FOMO-VL workshop