中文

用于跨模型间隙的轻量扩散模块 DiffGAP

计算机视觉与模式识别 2025-03-18 v1 人工智能 机器学习 声音 音频与语音处理

摘要

近期在跨模态理解和生成方面的工作,如 CLAP(Contrastive Language-Audio Pretraining)和 CAVP(Contrastive Audio-Visual Pretraining),显著通过单一对抗损失增强了文本、视频和音频嵌入之间的对齐。然而,这些方法常常忽略每种模态中存在的双向相互作用和内在噪声,这些因素可能严重影响跨模态集成的质量和效果。为解决这一局限性,本文引入 DiffGAP,一种在对抗空间中包含轻量生成模块的新方法。具体而言,DiffGAP 采用针对性地跨模态桥接的双向扩散过程。该过程对文本和视频嵌入以音频嵌入为条件进行去噪,反之亦然,从而更有效地促进跨模态交互。我们的实验结果在 VGGSound 和 AudioCaps 数据集上表明,DiffGAP 在视频/文本-音频生成和检索任务中显著提升了性能,证明了其在增强跨模态理解和生成能力方面的有效性。

关键词

引用

@article{arxiv.2503.12131,
  title  = {DiffGAP: A Lightweight Diffusion Module in Contrastive Space for Bridging Cross-Model Gap},
  author = {Shentong Mo and Zehua Chen and Fan Bao and Jun Zhu},
  journal= {arXiv preprint arXiv:2503.12131},
  year   = {2025}
}