TACo:用于视频-文本对齐的令牌感知级联对比学习
计算机视觉与模式识别
2021-08-24 v1 人工智能
机器学习
摘要
对比学习已被广泛用于训练基于 transformer 的视觉-语言模型,以进行视频-文本对齐和多模态表示学习。本文提出一种称为令牌感知级联对比学习(TACo)的新算法,利用两种新技术改进对比学习。其一是令牌感知对比损失,通过考虑词的句法类别来计算。其动机在于观察到,对于视频-文本对,文本中的内容词(如名词和动词)比功能词更可能与视频中的视觉内容对齐。其次,应用级联采样方法生成一小组难负例,以高效估计多模态融合层的损失。为验证 TACo 的有效性,我们在实验中针对一组下游任务微调预训练模型,包括文本-视频检索(YouCook2、MSR-VTT 和 ActivityNet)、视频动作步骤定位(CrossTask)、视频动作分割(COIN)。结果表明,我们的模型在不同实验设置下相较先前方法均获得一致提升,在 YouCook2、MSR-VTT 和 ActivityNet 三个公开文本-视频检索基准上确立了新的 SOTA。
引用
@article{arxiv.2108.09980,
title = {TACo: Token-aware Cascade Contrastive Learning for Video-Text Alignment},
author = {Jianwei Yang and Yonatan Bisk and Jianfeng Gao},
journal= {arXiv preprint arXiv:2108.09980},
year = {2021}
}
备注
Accepted by ICCV 2021