中文

通过学习的声学嵌入与反馈延迟网络实现混响语音匹配

音频与语音处理 2025-10-28 v1

摘要

混响传递关于环境的关键声学线索,支持空间感知和沉浸感。对于听觉增强现实(AAR)系统,实时生成感官上符合情境的混响仍是关键挑战,尤其是在缺乏显式声学测量的情况下。我们通过将盲估计人工混响参数 formulated 为混响信号匹配任务,利用学习的房间声学先验来解决此问题。进一步,我们提出一种反馈延迟网络(FDN)结构,能够再现目标空间的频率依赖衰减时间以及直接-混响比。对该方法的实验评估表明,其相对于领先的自动 FDN 调谐方法在估计的房间声学参数和感官上符合情境的人工混响语音方面均取得改进。这些结果凸显了该方法在 AAR 应用中实现高效、感官上一致的混响渲染的潜力。

关键词

引用

@article{arxiv.2510.23158,
  title  = {Matching Reverberant Speech Through Learned Acoustic Embeddings and Feedback Delay Networks},
  author = {Philipp Götz and Gloria Dal Santo and Sebastian J. Schlecht and Vesa Välimäki and Emanuël A. P. Habets},
  journal= {arXiv preprint arXiv:2510.23158},
  year   = {2025}
}

备注

Submitted to ICASSP 2026