中文

RaP:面向文本-视频检索的冗余感知视频语言预训练

计算机视觉与模式识别 2022-10-14 v1 人工智能

摘要

视频语言预训练方法主要采用稀疏采样技术以缓解视频的时间冗余。尽管有效,稀疏采样仍遭受跨模态冗余:视觉冗余与文本冗余。相较于高度泛化的文本,稀疏采样的帧通常包含与文本无关的部分,称为视觉冗余。稀疏采样也可能遗漏对应某些文本部分的重要帧,导致文本冗余。跨模态冗余造成视频与文本信息的不匹配,阻碍模型更好地学习跨模态共享语义。为缓解该问题,我们提出冗余感知视频语言预训练。我们通过计算跨模态最小不相似度,设计了对视频块与文本词元的冗余度量。随后,我们通过提出的冗余感知对比学习对高冗余视频块与文本词元施加惩罚。我们在四个基准数据集 MSRVTT、MSVD、DiDeMo 与 LSMDC 上评估了我们的方法,相较先前最优结果取得了显著提升。我们的代码发布于 https://github.com/caskcsg/VLP/tree/main/RaP。

关键词

引用

@article{arxiv.2210.06881,
  title  = {RaP: Redundancy-aware Video-language Pre-training for Text-Video Retrieval},
  author = {Xing Wu and Chaochen Gao and Zijia Lin and Zhongyuan Wang and Jizhong Han and Songlin Hu},
  journal= {arXiv preprint arXiv:2210.06881},
  year   = {2022}
}

备注

EMNLP 2022