中文

多通道多说话者变换器用于语音识别

声音 2026-01-07 v1 人工智能

摘要

随着视频会议和车载语音助手的发展,远场多说话者语音识别已成为热门研究主题。最近提出了一种多通道变换器(MCT),表明变换器能够建模远场声学环境。然而,MCT 由于说话者之间的干扰,无法对混合输入音频中每个说话者的高维声学特征进行编码。基于此,本文提出了一种用于远场多说话者语音识别的多通道多说话者变换器(M2Former)。在 SMS-WSJ 基准测试上实验表明,M2Former 分别在相对词错误率降低方面优于神经网络波束赋予器、MCT、双路径 RNN 结合 transform-average-concatenate 以及基于多通道深层聚类的端到端系统,分别提升 9.2%、14.3%、24.9% 和 52.2%。

关键词

引用

@article{arxiv.2601.02688,
  title  = {Multi-channel multi-speaker transformer for speech recognition},
  author = {Guo Yifan and Tian Yao and Suo Hongbin and Wan Yulong},
  journal= {arXiv preprint arXiv:2601.02688},
  year   = {2026}
}

备注

Proc. INTERSPEECH 2023, 5 pages