中文

单声道音频的端到端多说话人自动语音识别综述

计算与语言 2026-05-29 v3 人工智能 声音 音频与语音处理

摘要

单声道多说话人自动语音识别(ASR)仍具有数据稀缺和识别个体说话人并将单词归属于单个说话人的内在困难,特别是在重叠语音情况下。近期进展推动了从级联系统向端到端(E2E)架构的转变,这些架构减少了误差传播,更好地利用语音内容与说话人身份之间的协同作用。尽管E2E多说话人ASR取得了快速进展,但该领域缺乏对最新发展的全面综述。本综述提供了E2E神经方法的系统分类,突出了最新进展和比较分析。具体而言,我们分析了:(1)针对预分割音频的架构范式(SIMO vs.~SISO),分析其 distinct 特征和权衡; (2)基于这两种范式的最新架构和算法改进; (3)对长篇语音的扩展,包括分段策略和说话人一致假设拼接。进一步,我们(4)在标准基准测试上评估和比较方法。我们随后讨论了面向构建稳健且可扩展的多说话人ASR的开放挑战和未来研究方向。

关键词

引用

@article{arxiv.2505.10975,
  title  = {Survey of End-to-End Multi-Speaker Automatic Speech Recognition for Monaural Audio},
  author = {Xinlu He and Jacob Whitehill},
  journal= {arXiv preprint arXiv:2505.10975},
  year   = {2026}
}

备注

Accepted for publication in Computer Speech & Language (CSL)