CrossCLR:用于多模态视频表示的跨模态对比学习
计算机视觉与模式识别
2021-10-01 v1 人工智能
机器学习
摘要
对比学习使我们能够通过将正样本对与负样本集进行对比来灵活定义强大的损失函数。近来,该原理也被用于学习视频与文本的跨模态嵌入,但尚未充分挖掘其潜力。特别地,以往的损失未考虑模态内相似性,导致嵌入效率低下,因为相同内容被映射到嵌入空间中的多个点。我们提出CrossCLR,一种解决此问题的对比损失。此外,我们根据输入嵌入定义高度相关的样本集,并将其从负样本中排除,以避免假负样本问题。我们表明这些原则持续提升所学嵌入的质量。CrossCLR学习的联合嵌入在Youcook2与LSMDC数据集的视频-文本检索任务上,以及在Youcook2数据集的视频字幕任务上,大幅扩展了SOTA。我们还通过学习其他模态对的改进联合嵌入展示了该概念的通用性。
引用
@article{arxiv.2109.14910,
title = {CrossCLR: Cross-modal Contrastive Learning For Multi-modal Video Representations},
author = {Mohammadreza Zolfaghari and Yi Zhu and Peter Gehler and Thomas Brox},
journal= {arXiv preprint arXiv:2109.14910},
year = {2021}
}
备注
ICCV 2021, 14 pages, 13 figures