高效学习型声传播用于虚拟与现实世界音频处理应用
声音
2024-09-25 v1 音频与语音处理
摘要
声传播是声能通过介质(如空气)传播到周围环境的过程,形成声波。房间脉冲响应 (RIR) 描述了这一过程,受源位置、听者位置、房间几何形状及其材料的影响。物理基准声学模拟器已用于数十年计算特定声学环境的准确 RIR。然而,我们发现现有声学模拟器存在局限性。为此,我们提出了三种新型解决方案。首先,我们引入一种学习型 RIR 生成器,速度比交互式光线追踪模拟器快两个数量级。我们的 method 能够直接接受统计参数和传统参数进行训练,能够为重建场景和合成场景生成单声道和双声道 RIR。我们的生成 RIR 在语音处理应用中(包括自动语音识别、语音增强和语音分离)优于交互式光线追踪模拟器。其次,我们提出从回声语音信号和视觉线索估计 RIR,而无需环境的 3D 表示。通过从回声语音中估计 RIR,我们可以增强训练数据以匹配测试数据,显著改善自动语音识别系统的词错误率。我们估计的 RIR 在远场 ASR 任务中相对于以前的学习型 RIR 估计器实现了 6.9% 的改进。我们展示了该音视频 RIR 估计器在视觉声学匹配、新视角声学合成和语音配音等任务中的有效性,通过感知评估进行验证。最后,我们引入 IR-GAN 来增强准确的 RIR。IR-GAN 从真实 RIR 中学习声学参数,以生成模仿不同声学环境的新 RIR,在远场 ASR 基准测试中 outperform 光线追踪模拟器 8.95%。
引用
@article{arxiv.2409.15335,
title = {Efficient learning-based sound propagation for virtual and real-world audio processing applications},
author = {Anton Jeran Ratnarajah},
journal= {arXiv preprint arXiv:2409.15335},
year = {2024}
}
备注
PhD thesis