CLOP:基于知识正则化的视频与语言预训练
计算机视觉与模式识别
2022-11-08 v1 计算与语言
摘要
视频与语言预训练在学习可泛化表征方面已显示出有前景的结果。大多数现有方法通常以隐式方式对视频和文本建模,未考虑多模态内容的显式结构表征。我们将此类表征称为结构知识,其表达了多粒度的丰富语义。已有相关工作提出对象感知方法以类似知识作为输入注入。然而,现有方法通常未能有效利用此类知识作为正则化来塑造更优的跨模态表征空间。为此,我们提出一种带知识正则化的跨模态知识增强预训练(CLOP)方法。我们的两个关键设计为:1)一个简单而有效的结构知识预测(SKP)任务,以拉近相似视频的潜在表征;以及 2)一种用于对比学习(KCL)的知识引导采样新方法,以推远跨模态困难负样本。我们在四个文本-视频检索任务和一个多选问答任务上评估了我们的方法。实验显示出明确的提升,以显著优势超越先前工作。此外,我们提供了消融实验及关于我们的方法如何影响潜在表征空间的洞见,证明了将知识正则化引入视频与语言预训练的价值。
引用
@article{arxiv.2211.03314,
title = {CLOP: Video-and-Language Pre-Training with Knowledge Regularizations},
author = {Guohao Li and Hu Yang and Feng He and Zhifan Feng and Yajuan Lyu and Hua Wu and Haifeng Wang},
journal= {arXiv preprint arXiv:2211.03314},
year = {2022}
}
备注
ACM Multimedia 2022 (MM'22)