中文

CUPID:面向视频与语言表征学习的预训练数据自适应筛选

计算机视觉与模式识别 2021-04-14 v2

摘要

本工作关注视频-语言预训练与表征学习。在这一如今无处不在的训练方案中,模型首先在一个大型未筛选源语料库上的配对视频与文本(例如视频片段与 accompanying 字幕)上执行预训练,然后迁移到特定下游任务。这一两阶段训练过程不可避免地引发关于预训练模型泛化能力的问题,当源数据与目标数据之间存在显著领域鸿沟时(例如教学烹饪视频 vs. 电影)尤为突出。本文中,我们首先揭示预训练目标(对比式 vs. 重建式)对领域差异的敏感性。随后,我们提出一个简单而有效的框架 CUPID,通过筛选并将源数据适配到目标数据,接着进行领域聚焦的预训练,来弥合这一领域鸿沟。综合实验表明,与随机采样甚至利用完整预训练数据集相比,在相当小的领域聚焦数据子集上预训练能有效缩小源-目标领域鸿沟并取得显著性能提升。CUPID 在多个视频-语言和视频任务上取得新的 SOTA 性能,包括文本到视频检索 [72, 37]、视频问答 [36] 和视频描述生成 [72],在不同预训练方法上均有持续性能提升。

关键词

引用

@article{arxiv.2104.00285,
  title  = {CUPID: Adaptive Curation of Pre-training Data for Video-and-Language Representation Learning},
  author = {Luowei Zhou and Jingjing Liu and Yu Cheng and Zhe Gan and Lei Zhang},
  journal= {arXiv preprint arXiv:2104.00285},
  year   = {2021}
}

备注

12 pages, 4 figures