中文

面向多通道视频-语言检索的预训练对比模型快速适配

计算机视觉与模式识别 2023-04-12 v4

摘要

多通道视频-语言检索要求模型理解来自不同通道(例如视频+问题、视频+语音)的信息,以正确地将视频与文本响应或查询相关联。幸运的是,对比多模态模型被证明在对齐图像/视频与文本中的实体方面极为有效,例如 CLIP;文本对比模型因其生成判别性句子嵌入的强大能力而近期被广泛研究,例如 SimCSE。然而,尚无明确方法能在有限数据与资源下将这两类模型快速适配到多通道视频-语言检索。本文确立了一个原则性的模型设计空间,其包含两个维度:如何表示视频,以及如何融合视频与文本信息。基于近期方法的分类,我们研究了使用连续特征向量或离散文本词元表示视频的选项;对于融合方法,我们探索了使用多模态 transformer 或预训练对比文本模型。我们在五个视频-语言数据集上广泛评估了这四种组合。我们惊讶地发现,离散文本词元与预训练对比文本模型相结合取得了最佳性能,其甚至可在无需额外使用数百万视频-文本数据训练的情况下,在 iVQA 和 How2QA 数据集上超越最先进水平。进一步分析表明,这是因为将视频表示为文本词元捕捉了关键视觉信息,且文本词元在对比预训练过程后与强大的检索器文本模型自然对齐。所有实证分析为未来关于可负担且可升级的多模态智能研究奠定了坚实基础。

关键词

引用

@article{arxiv.2206.02082,
  title  = {Towards Fast Adaptation of Pretrained Contrastive Models for Multi-channel Video-Language Retrieval},
  author = {Xudong Lin and Simran Tiwari and Shiyuan Huang and Manling Li and Mike Zheng Shou and Heng Ji and Shih-Fu Chang},
  journal= {arXiv preprint arXiv:2206.02082},
  year   = {2023}
}

备注

To appear in CVPR 2023; The code will be released at https://github.com/XudongLinthu/upgradable-multimodal-intelligence