中文

基于声学参数的房间脉冲响应生成

声音 2025-07-17 v1 音频与语音处理

摘要

使用深度神经网络生成房间脉冲响应(RIR)已引起日益增长的研究兴趣,由于其在虚拟现实、增强现实、音频后期制作等领域的应用。大多数现有方法依赖于房间的尺寸、形状和表面材料等物理描述进行建模生成。然而,这种对几何信息的依赖限制了其在房间布局未知或感知现实感(即空间对听者而言的声音感受)比严格物理准确性更为重要的场景中的可用性。本研究提出了另一种策略:直接基于一组RIR声学参数进行条件化生成。这包括各种混合带宽和频段的混响时间和直接声到混响比的各种度量。通过指定空间应如何发声而非如何外观,本方法实现了更灵活且以感知为导向的RIR生成。我们探索了在Descript音频编解码器域中使用的自回归和非自回归生成模型,采用离散标记序列或连续嵌入。具体而言,我们选取了四个模型进行评估:一个自回归变换器、MaskGIT模型、流匹配模型以及基于分类器的方法。进行客观和主观评估,以比较这些方法与最新方法。结果表明,所提出的模型与最新方法相当或更优,MaskGIT模型取得了最佳性能。

关键词

引用

@article{arxiv.2507.12136,
  title  = {Room Impulse Response Generation Conditioned on Acoustic Parameters},
  author = {Silvia Arellano and Chunghsin Yeh and Gautam Bhattacharya and Daniel Arteaga},
  journal= {arXiv preprint arXiv:2507.12136},
  year   = {2025}
}

备注

4+1 pages, 2 figures; accepted in IEEE Workshop on Applications of Signal Processing to Audio and Acoustics (WASPAA 2025)