中文

扬声器波束成形提升语音驱动应用的语音识别性能

音频与语音处理 2025-05-21 v1 声音

摘要

本文提出了一种鲁棒的扬声器波束成形算法,用于在扬声器引入大部分噪声的场景(例如音乐大声播放时)提升语音驱动应用的性能。该扬声器波束成形器修改扬声器播放信号,以在实现语音驱动应用(VDA)的自动语音识别设备周围创建一个低声学能量区域。该算法利用基于人类听觉感知的失真度量来限制人类听众感知到的失真。仿真和实际实验表明,所提出的扬声器波束成形器在所有测试场景中均提升了语音识别性能。此外,该算法允许进一步降低VDA设备周围的声学能量,但代价是听众位置处的客观音频质量下降。

关键词

引用

@article{arxiv.2501.08104,
  title  = {Loudspeaker Beamforming to Enhance Speech Recognition Performance of Voice Driven Applications},
  author = {Dimme de Groot and Baturalp Karslioglu and Odette Scharenborg and Jorge Martinez},
  journal= {arXiv preprint arXiv:2501.08104},
  year   = {2025}
}

备注

To appear at ICASSP 2025