中文

用于音视频分割的对比条件隐扩散模型

计算机视觉与模式识别 2025-07-02 v2 多媒体 声音 音频与语音处理

摘要

我们提出了一种用于音视频分割(AVS)的对比条件隐扩散模型,以深入探究音频的影响,其中对音频与最终分割图之间的相关性进行建模,以保证二者之间的强相关性。为实现语义相关的表示学习,我们的框架引入了一个隐扩散模型。该扩散模型学习真实分割图的条件生成过程,从而在测试阶段的去噪过程中实现感知真实结果的推理。由于我们的模型是条件式的,确保条件变量对模型输出有贡献至关重要。因此,我们通过最小化多模态数据(如以音视频数据为条件)与单模态数据(如仅以音频数据为条件)的条件概率之间的密度比,来充分建模音频信号的贡献。如此,我们通过密度比优化使隐扩散模型显式地最大化音频对 AVS 的贡献,并可借助对比学习作为约束来实现,其中扩散部分作为主目标以实现最大似然估计,而密度比优化部分施加约束。通过采用这种基于对比学习的隐扩散模型,我们有效增强了音频对 AVS 的贡献。我们在基准数据集上的实验结果验证了我们方案的有效性。代码与结果已通过我们的项目页面发布:https://github.com/OpenNLPLab/DiffusionAVS。

关键词

引用

@article{arxiv.2307.16579,
  title  = {Contrastive Conditional Latent Diffusion for Audio-visual Segmentation},
  author = {Yuxin Mao and Jing Zhang and Mochu Xiang and Yunqiu Lv and Dong Li and Yiran Zhong and Yuchao Dai},
  journal= {arXiv preprint arXiv:2307.16579},
  year   = {2025}
}