面向端到端说话人属性ASR的最小贝叶斯风险训练
音频与语音处理
2020-11-06 v1 计算与语言
声音
摘要
近来,一种端到端说话人属性自动语音识别(E2E SA-ASR)模型被提出,作为针对单声道重叠语音的说话人计数、语音识别与说话人识别的联合模型。在先前研究中,模型参数基于说话人属性最大互信息(SA-MMI)准则训练,借此在训练数据上最大化多说话人转写与说话人识别的联合后验概率。尽管 SA-MMI 训练对由不同人数说话人组成的重叠语音展现出良好结果,该训练准则并未与最终评测指标即说话人属性词错误率(SA-WER)直接关联。本文提出一种说话人属性最小贝叶斯风险(SA-MBR)训练方法,其中参数被训练以直接在训练数据上最小化期望 SA-WER。使用 LibriSpeech 语料的实验表明,相较于 SA-MMI 训练模型,所提 SA-MBR 训练将 SA-WER 相对降低了 9.0%。
引用
@article{arxiv.2011.02921,
title = {Minimum Bayes Risk Training for End-to-End Speaker-Attributed ASR},
author = {Naoyuki Kanda and Zhong Meng and Liang Lu and Yashesh Gaur and Xiaofei Wang and Zhuo Chen and Takuya Yoshioka},
journal= {arXiv preprint arXiv:2011.02921},
year = {2020}
}
备注
Submitted to ICASSP 2021. arXiv admin note: text overlap with arXiv:2006.10930, arXiv:2008.04546