从视频中自动生成面向语言的对比音视频掩码自编码器
计算机视觉与模式识别
2025-07-17 v1 音频与语音处理
图像与视频处理
摘要
本文提出了Language-Guided Contrastive Audio-Visual Masked Autoencoders(LG-CAV-MAE),以提高音视频表征学习。LG-CAV-MAE将预训练文本编码器集成到对比音视频掩码自编码器中,使模型能够在音频、视觉和文本三个模态之间学习。为了训练LG-CAV-MAE,我们引入了一种自动从无标记视频中生成音视频文本三元组的方法。我们首先使用图像描述模型生成帧级描述,然后应用CLAP-based过滤确保音频与描述之间的强对齐。该方法在无需手动标注的情况下产生高质量的音视频文本三元组。我们在音视频检索任务以及音视频分类任务上评估了LG-CAV-MAE。我们的方法显著优于现有方法,在检索任务中实现了最高5.6%的recall@10提升,在分类任务中实现了3.2%的提升。
引用
@article{arxiv.2507.11967,
title = {Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos},
author = {Yuchi Ishikawa and Shota Nakada and Hokuto Munakata and Kazuhiro Saito and Tatsuya Komatsu and Yoshimitsu Aoki},
journal= {arXiv preprint arXiv:2507.11967},
year = {2025}
}
备注
Interspeech 2025