用于紧凑视频-语言表示的期望最大化对比学习
计算机视觉与模式识别
2022-11-22 v1
摘要
大多数视频-语言表示学习方法采用对比学习(如 CLIP),根据文本-视频对的语义相似度将视频和文本特征投影到共同的潜在空间中。然而,这种学习到的共享潜在空间往往不是最优的,视觉与文本表示之间的模态鸿沟无法被完全消除。本文中,我们提出期望最大化对比学习(EMCL)来学习紧凑的视频-语言表示。具体而言,我们使用期望最大化算法为潜在空间寻找一组紧凑的基,其中特征可以简洁地表示为这些基的线性组合。这种视频-语言表示的分解降低了潜在空间的秩,从而增强了语义的表示能力。在三个基准文本-视频检索数据集上的大量实验证明,我们的 EMCL 能够学习比以往方法更具判别力的视频-语言表示,并在所有指标上显著优于以往的最先进方法。更令人鼓舞的是,所提方法既可作为联合训练层,也可作为无需额外训练的开箱即用推理模块来提升现有方法的性能,使其易于集成到任何现有方法中。
引用
@article{arxiv.2211.11427,
title = {Expectation-Maximization Contrastive Learning for Compact Video-and-Language Representations},
author = {Peng Jin and Jinfa Huang and Fenglin Liu and Xian Wu and Shen Ge and Guoli Song and David A. Clifton and Jie Chen},
journal= {arXiv preprint arXiv:2211.11427},
year = {2022}
}
备注
Accepted to NeurIPS 2022