面向多说话人对话 ASR 的说话人条件声学建模
音频与语音处理
2022-08-30 v2
摘要
本文提出了一种从单通道语音录音中对具有自然说话人重叠的语音对话进行转写的新方法。所提模型由说话人日志系统和混合自动语音识别(ASR)系统组合而成。ASR 系统中的说话人条件声学模型(SCAM)包含一系列嵌入层,其利用来自日志系统的说话人活动输入来推导说话人特定嵌入。SCAM 的输出是用于对对话中每位说话人转写进行解码的说话人特定 senone。本工作中,我们尝试使用端到端说话人日志系统生成的自动说话人活动决策。还提出了一种联合学习方法,其中日志模型与 ASR 声学模型被联合优化。实验在 Switchboard 电话对话语料库的多通道双说话人录音上进行。在这些实验中,我们表明所提声学模型结合说话人活动决策与联合优化,相比具有显式源滤波的 ASR 系统有显著改进(词错误率(WER)相对基线系统提升 12%)。
引用
@article{arxiv.2104.01882,
title = {Speaker conditioned acoustic modeling for multi-speaker conversational ASR},
author = {Srikanth Raj Chetupalli and Sriram Ganapathy},
journal= {arXiv preprint arXiv:2104.01882},
year = {2022}
}
备注
Manuscript accepted for presentation at Interspeech 2022