中文

RIR-SF:基于房间脉冲响应的多通道多说话人场景下目标语音识别空间特征

音频与语音处理 2024-06-13 v2 人工智能

摘要

在多说话人录音上的自动语音识别(ASR)具有挑战性。当前利用多通道音频的 3D 空间数据与视觉线索的方法主要关注来自目标说话人的直达波,忽视了反射波的影响,这在混响环境中阻碍了性能。我们的研究引入了 RIR-SF,一种基于房间脉冲响应(RIR)的新型空间特征,其利用了说话人位置、房间声学以及反射动态。RIR-SF 显著优于传统 3D 空间特征,展现出更优的理论与经验性能。我们还提出了一种针对 RIR-SF 优化的全神经多通道 ASR 框架,在多通道设置下对目标说话人 ASR 实现了 21.3% 的相对字错率(CER)降低。RIR-SF 提升了识别准确率,并在高混响场景中展现出鲁棒性,克服了先前方法的局限。

关键词

引用

@article{arxiv.2311.00146,
  title  = {RIR-SF: Room Impulse Response Based Spatial Feature for Target Speech Recognition in Multi-Channel Multi-Speaker Scenarios},
  author = {Yiwen Shao and Shi-Xiong Zhang and Dong Yu},
  journal= {arXiv preprint arXiv:2311.00146},
  year   = {2024}
}

备注

Accepted for presentation at Interspeech 2024