基于扩散转换器的语音与文本生成房间脉冲响应
声音
2026-02-11 v1 音频与语音处理
摘要
盲声房脉冲响应(RIR)估计是捕获和传递声学特性的核心任务,但现有方法往往受限于建模能力,在不可见条件下性能下降。此外,越来越多的生成式音频应用需要更灵活的脉冲响应生成方法。我们提出了Gencho,一种基于扩散转换器的模型,从回声语音中预测复杂频谱RIR。结构感知编码器利用早期和晚期反射之间的隔离特性,将输入音频编码为稳健的条件表示;而扩散解码器则从中生成多样且感官上真实的脉冲响应。Gencho可模块化地集成到标准语音处理管道中,用于声学匹配。结果表明,生成的RIR在非生成基线之外更丰富,同时在标准RIR指标上保持出色性能。我们进一步演示了其用于文本条件RIR生成的应用,凸显了Gencho在可控声学模拟和生成式音频任务中的多功能性。
引用
@article{arxiv.2602.09233,
title = {Gencho: Room Impulse Response Generation from Reverberant Speech and Text via Diffusion Transformers},
author = {Jackie Lin and Jiaqi Su and Nishit Anand and Zeyu Jin and Minje Kim and Paris Smaragdis},
journal= {arXiv preprint arXiv:2602.09233},
year = {2026}
}
备注
In Proc. of the IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) 2026. Audio examples available at https://linjac.github.io/Gencho/