用于文本-视频检索的归一化对比学习
信息检索
2022-12-23 v1 计算机视觉与模式识别
机器学习
摘要
跨模态对比学习以其简洁性和有效性引领了多模态检索的最新进展。然而,本工作揭示出跨模态对比学习存在对每个文本或视频实例的检索概率之和归一化不正确的问题。具体而言,我们表明许多测试实例在检索过程中或被过度表示或被表示不足,严重损害了检索性能。为解决该问题,我们提出归一化对比学习(NCL),其利用Sinkhorn-Knopp算法计算实例级偏置,以恰当归一化每个实例的检索概率之和,从而使每个文本和视频实例在跨模态检索中得到公平表示。实证研究表明,NCL在不同模型架构上为文本-视频检索带来了持续且显著的提升,并在ActivityNet、MSVD和MSR-VTT数据集上取得了新的最先进多模态检索指标,且无需任何架构设计。
引用
@article{arxiv.2212.11790,
title = {Normalized Contrastive Learning for Text-Video Retrieval},
author = {Yookoon Park and Mahmoud Azab and Bo Xiong and Seungwhan Moon and Florian Metze and Gourab Kundu and Kirmani Ahmed},
journal= {arXiv preprint arXiv:2212.11790},
year = {2022}
}
备注
Published in EMNLP 2022