基于可微弱时间对齐的视频-文本表示学习
计算机视觉与模式识别
2022-04-01 v1
摘要
通过监督方法学习视频与文本的通用联合表示需要大量人工标注的视频数据集,成本高昂。作为实用的替代方案,近期引入了大规模但未加筛选且带旁白的视频数据集HowTo100M。但由于其模糊性和非顺序对齐,以自监督方式学习视频与文本的联合嵌入仍然具有挑战性。本文提出一种新颖的多模态自监督框架——基于视频-文本时间弱对齐的对比学习(VT-TWINS),利用动态时间规整(DTW)的一种变体从噪声和弱相关数据中提取重要信息。我们观察到标准DTW固有地无法处理弱相关数据,且只考虑全局最优对齐路径。为解决这些问题,我们开发了可微DTW,其同时反映具有弱时间对齐的局部信息。此外,我们提出的模型应用对比学习方案在弱相关数据上学习特征表示。大量实验表明,VT-TWINS在多模态表示学习上取得显著改进,并在多项具有挑战性的下游任务中优于其他方法。代码见https://github.com/mlvlab/VT-TWINS。
引用
@article{arxiv.2203.16784,
title = {Video-Text Representation Learning via Differentiable Weak Temporal Alignment},
author = {Dohwan Ko and Joonmyung Choi and Juyeon Ko and Shinyeong Noh and Kyoung-Woon On and Eun-Sol Kim and Hyunwoo J. Kim},
journal= {arXiv preprint arXiv:2203.16784},
year = {2022}
}