PromptReverb:基于潜在流动校准的多模态房间脉冲响应生成
声音
2025-10-30 v2 人工智能
摘要
房间脉冲响应(RIR)生成仍是创建沉浸式虚拟声学环境的关键挑战。现有方法存在两个根本局限:充分带宽RIR数据集的稀缺,以及现有模型无法从多样化输入模态生成准确的声学响应。我们提出PromptReverb,一个两阶段生成框架以解决这些挑战。该方法结合变分自编码器对受限带宽RIR进行升采样至全带宽质量(48 kHz),并基于潜在流动校准(rectified flow matching)的条件扩散转换模型,从自然语言描述生成RIR。实证评估表明,PromptReverb生成的RIR在感知质量和声学准确性方面优于现有方法,实现的平均RT60误差为8.8%,相较于广泛使用的基线为-37%,并产生更真实的房间声学参数。该方法在虚拟现实、建筑声学和音频制作等领域实现了灵活、高质量的RIR合成。
引用
@article{arxiv.2510.22439,
title = {PromptReverb: Multimodal Room Impulse Response Generation Through Latent Rectified Flow Matching},
author = {Ali Vosoughi and Yongyi Zang and Qihui Yang and Nathan Paek and Randal Leistikow and Chenliang Xu},
journal= {arXiv preprint arXiv:2510.22439},
year = {2025}
}
备注
9 pages, 2 figures, 4 tables; v2: corrected spelling of a co-author name; no content changes