中文

基于目标说话人单声段的多通道多说话人语音识别

音频与语音处理 2024-06-19 v2

摘要

在多通道、多说话人语音识别领域,区分并准确转录背景噪声中的目标说话人语音仍是一个巨大的挑战。传统方法通常依赖麦克风阵列配置和目标说话人位置或声纹信息。本研究引入了单声特征(Solo-SF),一种创新方法,利用目标说话人的孤立语音段落来增强语音识别性能,从而规避了传统输入方式,如麦克风阵列布局。我们探讨了选择最佳单声段落的有效策略,这对于Solo-SF的成功至关重要。通过在AliMeeting数据集和AISHELL-1模拟数据集上的评估,Solo-SF在各种测试条件下均优于现有技术,显著降低了字符错误率(CER)。我们的发现表明,Solo-SF作为解决多通道、多说话人语音识别复杂性的有效解决方案具有巨大的潜力。

关键词

引用

@article{arxiv.2406.09589,
  title  = {Multi-Channel Multi-Speaker ASR Using Target Speaker's Solo Segment},
  author = {Yiwen Shao and Shi-Xiong Zhang and Yong Xu and Meng Yu and Dong Yu and Daniel Povey and Sanjeev Khudanpur},
  journal= {arXiv preprint arXiv:2406.09589},
  year   = {2024}
}

备注

Accepted for presentation at Interspeech 2024