基于细粒度帧采样的对比视频-语言学习
机器学习
2022-10-12 v1 计算机视觉与模式识别
摘要
尽管视频和语言表示学习最近取得了进展,但两种模态之间微弱或稀疏的对应关系仍然是该领域的瓶颈。大多数视频-语言模型通过样本对级别的损失进行训练,以预测一对视频和文本是否对齐。然而,即使在成对的视频-文本片段中,也只有一部分帧在语义上与相应的文本相关,其余部分代表噪声;视频越长,噪声帧的比例就越高。我们提出了 FineCo(用于帧采样的细粒度对比损失),这是一种通过在视频帧上操作细粒度对比目标来更好地学习视频和语言表示的方法。它通过选择与文本语义等价的帧来帮助提取视频摘要,从而改善跨模态对应关系。以成熟的 VideoCLIP 模型为起点,FineCo 在 YouCookII(一个包含长视频的文本-视频检索基准测试)上取得了最先进的性能。FineCo 还在包含较短视频的文本-视频检索(MSR-VTT)和视频问答数据集(MSR-VTT QA 和 MSR-VTT MC)上取得了具有竞争力的结果。
引用
@article{arxiv.2210.05039,
title = {Contrastive Video-Language Learning with Fine-grained Frame Sampling},
author = {Zixu Wang and Yujie Zhong and Yishu Miao and Lin Ma and Lucia Specia},
journal= {arXiv preprint arXiv:2210.05039},
year = {2022}
}
备注
AACL-IJCNLP 2022