基于同步音频的统一视频语言预训练
计算机视觉与模式识别
2024-05-14 v1 人工智能
机器学习
多媒体
声音
音频与语音处理
摘要
视频语言预训练是旨在从大规模数据中以自监督方式学习视觉和文本表示的典型且具有挑战性的问题。现有预训练方法要么捕获图像文本对的对应关系,要么利用帧的时间顺序。然而,他们未显式探索音频与另两种模态之间的自然同步。本文提出了一种增强框架,用于基于同步音频的视频语言预训练,称为 VLSA,该框架可在统一的自监督变换器中学习三模态表示。具体而言,我们的 VLSA 同时聚合视频、文本和音频的局部图像块和全局标记嵌入。此外,我们利用局部图像块掩码建模来学习受模态影响的特征,利用全局音频匹配来捕获音频引导的视频和文本特征。我们在文本、视频和音频跨检索任务上进行了大量实验。我们的简单模型仅使用 0.9M 数据即可实现优于最新基线的结果。此外,定性可视化生动展示了 VLSA 在学习判别性视觉文本表示方面的优势。
引用
@article{arxiv.2405.07202,
title = {Unified Video-Language Pre-training with Synchronized Audio},
author = {Shentong Mo and Haofan Wang and Huaxia Li and Xu Tang},
journal= {arXiv preprint arXiv:2405.07202},
year = {2024}
}