定向ASR:一种基于源定位的端到端多说话人语音识别新范式
音频与语音处理
2020-11-03 v1 计算与语言
声音
摘要
本文提出一种以端到端神经网络方式处理远场多说话人数据的新范式,称为定向自动语音识别(D-ASR),其显式建模源说话人位置。在D-ASR中,源相对于麦克风阵列的方位角被定义为潜变量。该角度控制分离质量,进而决定ASR性能。D-ASR的全部三种功能——定位、分离与识别——被连接为单一可微神经网络,并仅基于ASR误差最小化目标进行训练。D-ASR相对于现有方法的优势有三: (1) 提供显式说话人位置, (2) 提升可解释性因子, (3) 因流程更 streamlined 而实现更优ASR性能。此外,D-ASR不需要像现有数据驱动定位模型那样显式的到达方向(DOA)监督,这使其更适用于真实数据。对于双源混合情形,D-ASR实现了小于三度的平均DOA预测误差。它在分离质量与ASR性能上均优于一个强大的远场多说话人端到端系统。
引用
@article{arxiv.2011.00091,
title = {Directional ASR: A New Paradigm for E2E Multi-Speaker Speech Recognition with Source Localization},
author = {Aswin Shanmugam Subramanian and Chao Weng and Shinji Watanabe and Meng Yu and Yong Xu and Shi-Xiong Zhang and Dong Yu},
journal= {arXiv preprint arXiv:2011.00091},
year = {2020}
}
备注
submitted to ICASSP 2021