中文

面向真实远场麦克风会议转录的联合波束成形与说话人归属ASR

计算与语言 2025-07-09 v2

摘要

远场麦克风会议转录是一项具有挑战性的任务。最先进的端到端说话人归属自动语音识别(SA-ASR)架构缺乏多通道噪声和混响抑制前端,这限制了其性能。在本文中,我们为真实会议转录引入了一种联合波束成形与SA-ASR的方法。我们首先描述了一种数据对齐和增强方法,用于在真实会议数据上预训练神经波束成形器。然后,我们比较了固定、混合和全神经波束成形器作为SA-ASR模型前端的性能。最后,我们联合优化了全神经波束成形器和SA-ASR模型。在真实AMI语料库上的实验表明,虽然最先进的基于多帧跨通道注意力的通道融合未能改善ASR性能,但在固定波束成形器输出上微调SA-ASR以及将SA-ASR与神经波束成形器联合微调,分别将词错误率相对降低了8%和9%。

关键词

引用

@article{arxiv.2410.21849,
  title  = {Joint Beamforming and Speaker-Attributed ASR for Real Distant-Microphone Meeting Transcription},
  author = {Can Cui and Imran Ahamad Sheikh and Mostafa Sadeghi and Emmanuel Vincent},
  journal= {arXiv preprint arXiv:2410.21849},
  year   = {2025}
}