中文

从视频中自动生成面向语言的对比音视频掩码自编码器

计算机视觉与模式识别 2025-07-17 v1 音频与语音处理 图像与视频处理

摘要

本文提出了Language-Guided Contrastive Audio-Visual Masked Autoencoders(LG-CAV-MAE),以提高音视频表征学习。LG-CAV-MAE将预训练文本编码器集成到对比音视频掩码自编码器中,使模型能够在音频、视觉和文本三个模态之间学习。为了训练LG-CAV-MAE,我们引入了一种自动从无标记视频中生成音视频文本三元组的方法。我们首先使用图像描述模型生成帧级描述,然后应用CLAP-based过滤确保音频与描述之间的强对齐。该方法在无需手动标注的情况下产生高质量的音视频文本三元组。我们在音视频检索任务以及音视频分类任务上评估了LG-CAV-MAE。我们的方法显著优于现有方法,在检索任务中实现了最高5.6%的recall@10提升,在分类任务中实现了3.2%的提升。

关键词

引用

@article{arxiv.2507.11967,
  title  = {Language-Guided Contrastive Audio-Visual Masked Autoencoder with Automatically Generated Audio-Visual-Text Triplets from Videos},
  author = {Yuchi Ishikawa and Shota Nakada and Hokuto Munakata and Kazuhiro Saito and Tatsuya Komatsu and Yoshimitsu Aoki},
  journal= {arXiv preprint arXiv:2507.11967},
  year   = {2025}
}

备注

Interspeech 2025