基于视觉场景驱动的扩散模型的声学匹配与去回声的相互学习
声音
2024-07-16 v1 人工智能
计算机视觉与模式识别
音频与语音处理
摘要
视觉声学匹配(VAM)是增强沉浸式体验的关键,而去回声(dereverberation)则有助于提高音频可理解性。现有方法将每个任务独立处理,忽视了它们之间固有的相互关系。此外,这些方法依赖配对训练数据,而获取配对数据具有挑战性,限制了大规模非配对数据的利用。本文引入了 MVSD,这是一个基于扩散模型的相互学习框架。MVSD 对这两个任务进行对称处理,利用其逆向关系来促进从逆向任务的学习并克服数据稀缺问题。进一步地,我们采用扩散模型作为基础条件转换器,以规避传统 GAN 架构的训练不稳定和过平滑问题。具体而言,MVSD 使用两个转换器:一个用于 VAM 的回声转换器(reverberator),一个用于去回声的去回声器(dereverberator)。去回声器判断由回声转换器生成的回声音频是否像来自给定的视觉场景,反之亦然。通过形成闭环,这两个转换器可以为逆向任务生成有信息的反馈信号,即使仅使用容易获取的单向非配对数据亦可实现优化。在两个标准基准(SoundSpaces-Speech 和 Acoustic AVSpeech)上的大量实验表明,我们的框架能够提升回声转换器和去回声器的性能,并更好地匹配指定的视觉场景。
引用
@article{arxiv.2407.10373,
title = {Mutual Learning for Acoustic Matching and Dereverberation via Visual Scene-driven Diffusion},
author = {Jian Ma and Wenguan Wang and Yi Yang and Feng Zheng},
journal= {arXiv preprint arXiv:2407.10373},
year = {2024}
}
备注
ECCV 2024; Project page: https://hechang25.github.io/MVSD