中文

基于流匹配的少样本声学合成

声音 2026-03-20 v1 计算机视觉与模式识别 音频与语音处理

摘要

生成与场景声学一致的音频对于沉浸式虚拟环境至关重要。最近的神经声学场方法实现了空间连续声音渲染,但仍限于特定场景,需为每个环境密集采集音频并进行高昂训练。少样本方法提高了不同房间间的可扩展性,但仍依赖多个录音记录,且作为确定性方法,无法捕捉在稀疏上下文下的场景声学固有的不确定性。我们引入了流匹配声学生成(FLAC),一种基于少样本的概率声学合成方法,通过最小场景上下文建模合理房间脉冲响应(RIR)的分布。FLAC利用以流匹配目标训练的扩散变换器,对新场景中的任意位置的RIR进行生成,条件依赖于空间、几何和声学线索。FLAC在AcousticRooms和Hearing Anything Anywhere数据集上,以一射程方式超越最新的八射程基线。为补充标准感知指标,我们进一步引入AGREE——一种联合声学-几何嵌入,使通过检索和分布指标对生成RIR进行几何一致性评估成为可能。这一工作首次将生成式流匹配应用于显式RIR合成,开辟了面向稳健和数据高效声学合成的新方向。

关键词

引用

@article{arxiv.2603.19176,
  title  = {Few-shot Acoustic Synthesis with Multimodal Flow Matching},
  author = {Amandine Brunetto},
  journal= {arXiv preprint arXiv:2603.19176},
  year   = {2026}
}

备注

To appear at CVPR 2026. 23 pages, 16 figures. Project Page: https://amandinebtto.github.io/FLAC/