中文

MuLTI:基于文本引导多路采样器与多选建模的高效视频语言理解

计算机视觉与模式识别 2024-03-04 v2 计算与语言 多媒体

摘要

视频语言理解在工业界有诸多应用,如视频问答、文本视频检索和多标签分类。现有视频语言理解方法普遍采用沉重的多模态编码器和特征融合模块,消耗高计算成本。特别地,它们难以处理工业应用中普遍存在的密集视频帧或长文本。本文提出 MuLTI,一种高精度高效的视频语言理解模型,实现高效有效的特征融合及对下游任务的快速适配。具体而言,我们设计基于适配池化残差映射和自注意力模块的文本引导多路采样器(Text-Guided MultiWay-Sampler)来采样长序列并融合多模态特征,降低了计算成本并解决了先前采样器导致的性能退化。因此,MuLTI 能以有限计算成本处理更长序列。进而,为进一步提升模型性能并弥补视频问答中预训练任务的缺失,我们提出名为多选建模(Multiple Choice Modeling)的新预训练任务。该任务弥合了预训练与下游任务间的鸿沟,并提升了模型对齐视频与文本特征的能力。得益于高效特征融合模块与新预训练任务,MuLTI 在多个数据集上取得最先进性能。实现与预训练模型将开源。

关键词

引用

@article{arxiv.2303.05707,
  title  = {MuLTI: Efficient Video-and-Language Understanding with Text-Guided MultiWay-Sampler and Multiple Choice Modeling},
  author = {Jiaqi Xu and Bo Liu and Yunkuo Chen and Mengli Cheng and Xing Shi},
  journal= {arXiv preprint arXiv:2303.05707},
  year   = {2024}
}