中文

PromptReverb:基于潜在流动校准的多模态房间脉冲响应生成

声音 2025-10-30 v2 人工智能

摘要

房间脉冲响应(RIR)生成仍是创建沉浸式虚拟声学环境的关键挑战。现有方法存在两个根本局限:充分带宽RIR数据集的稀缺,以及现有模型无法从多样化输入模态生成准确的声学响应。我们提出PromptReverb,一个两阶段生成框架以解决这些挑战。该方法结合变分自编码器对受限带宽RIR进行升采样至全带宽质量(48 kHz),并基于潜在流动校准(rectified flow matching)的条件扩散转换模型,从自然语言描述生成RIR。实证评估表明,PromptReverb生成的RIR在感知质量和声学准确性方面优于现有方法,实现的平均RT60误差为8.8%,相较于广泛使用的基线为-37%,并产生更真实的房间声学参数。该方法在虚拟现实、建筑声学和音频制作等领域实现了灵活、高质量的RIR合成。

关键词

引用

@article{arxiv.2510.22439,
  title  = {PromptReverb: Multimodal Room Impulse Response Generation Through Latent Rectified Flow Matching},
  author = {Ali Vosoughi and Yongyi Zang and Qihui Yang and Nathan Paek and Randal Leistikow and Chenliang Xu},
  journal= {arXiv preprint arXiv:2510.22439},
  year   = {2025}
}

备注

9 pages, 2 figures, 4 tables; v2: corrected spelling of a co-author name; no content changes