中文

对齐之前先标注:融合多模态标签用于视频-文本检索

计算机视觉与模式识别 2023-01-31 v1

摘要

近年来,面向视频-文本检索的视觉-语言对齐学习引起了广泛关注。现有方法大多要么将图像-文本预训练模型的知识迁移到视频-文本检索任务而未充分挖掘视频的多模态信息,要么在无明确引导的情况下以粗暴方式简单融合多模态特征。本文中,我们通过标注以显式方式融合多模态信息,并将标签作为锚点以实现更好的视频-文本对齐。我们利用多种预训练专家模型提取包括物体、人物、动作、音频等在内的多模态信息。为充分利用这些信息,我们提出 TABLE(TAgging Before aLignmEnt)网络,其由视觉编码器、标签编码器、文本编码器以及标签引导的跨模态编码器组成,用于联合编码多帧视觉特征与多模态标签信息。此外,为强化视频与文本间的交互,我们构建了以 [视觉、标签、文本] 三元组为输入的联合跨模态编码器,并执行视频-文本匹配(VTM)与掩码语言建模(MLM)两个额外的监督任务。大量实验结果表明,TABLE 模型能够在包括 MSR-VTT、MSVD、LSMDC 和 DiDeMo 在内的多个视频-文本检索基准上取得最先进(SOTA)性能。

关键词

引用

@article{arxiv.2301.12644,
  title  = {Tagging before Alignment: Integrating Multi-Modal Tags for Video-Text Retrieval},
  author = {Yizhen Chen and Jie Wang and Lijian Lin and Zhongang Qi and Jin Ma and Ying Shan},
  journal= {arXiv preprint arXiv:2301.12644},
  year   = {2023}
}

备注

Accepted to AAAI 2023 (Oral)