中文

GMS-CAVP:利用多尺度对比与生成预训练改进音视频对应

计算机视觉与模式识别 2026-01-28 v1 人工智能 机器学习 声音 音频与语音处理

摘要

视频-音频理解与生成的最新进展日益依赖于联合的V-A嵌入,这构成了跨模态检索和生成等任务的基础。虽然像CAVP这样的先前方法使用对比目标有效地建模了模态间的语义和时间对应关系,但其性能仍不理想。一个关键限制是对视频和音频信号的密集、多尺度性质建模不足——对应关系通常跨越从细粒度到粗粒度的时空结构,这在现有框架中未得到充分利用。为此,我们提出了GMS-CAVP,这是一个新颖的框架,结合了多尺度视频-音频对齐和多尺度时空扩散的预训练目标,以增强V-A对应建模。首先,GMS-CAVP引入了一种多尺度对比学习策略,捕获不同粒度下的语义和时间关系。其次,我们超越了传统的对比学习,通过引入基于扩散的生成目标,实现了视频和音频之间的模态翻译与合成。这种统一的判别-生成公式促进了更深入的跨模态理解,并为高保真生成铺平了道路。在VGGSound、AudioSet和Panda70M上的大量实验表明,GMS-CAVP在生成和检索方面优于先前的方法。

关键词

引用

@article{arxiv.2601.19606,
  title  = {GMS-CAVP: Improving Audio-Video Correspondence with Multi-Scale Contrastive and Generative Pretraining},
  author = {Shentong Mo and Zehua Chen and Jun Zhu},
  journal= {arXiv preprint arXiv:2601.19606},
  year   = {2026}
}