利用三维空间特征的多通道多说话人语音识别
声音
2021-11-23 v1 计算与语言
人机交互
机器学习
音频与语音处理
摘要
多通道多说话人重叠语音的自动语音识别(ASR)仍是语音界最具挑战性的任务之一。本文首次利用目标说话人在三维空间中的位置信息来应对这一挑战。为探究所提出的三维空间特征的优势,我们研究了两种范式:1)由多通道语音分离模块后接最先进的单通道ASR模块组成的流水线系统;2)无需显式分离模块、将三维空间特征直接作为ASR系统输入的“All-In-One”模型。两者均可完全微分并端到端反向传播。我们在模拟重叠语音和真实录音上测试了它们。实验结果表明:1)所提出的All-In-One模型达到了与流水线系统相当的错误率,同时将推理时间减少一半;2)所提出的三维空间特征在两个范式中均显著优于(31% CERR)以往所有使用一维方向信息的工作。
引用
@article{arxiv.2111.11023,
title = {Multi-Channel Multi-Speaker ASR Using 3D Spatial Feature},
author = {Yiwen Shao and Shi-Xiong Zhang and Dong Yu},
journal= {arXiv preprint arXiv:2111.11023},
year = {2021}
}