Conformer语音识别系统的因子化说话人-环境自适应训练
音频与语音处理
2023-06-27 v1 计算与语言
摘要
自然语音中丰富的多变性来源对当前数据密集型的语音识别技术提出了重大挑战。为同时建模说话人与环境层面的多样性,本文提出一种新颖的贝叶斯因子化说话人-环境自适应训练及测试时自适应方法,用于Conformer ASR模型。说话人与环境层面的特征分别使用紧凑的隐输出变换建模,随后线性或分层组合以表示任意说话人-环境组合。进一步利用贝叶斯学习对自适应参数的不确定性进行建模。在300小时WHAM噪声污染的Switchboard数据上的实验表明,因子化自适应始终优于基线及仅使用说话人标签自适应的Conformer,绝对词错误率最高降低3.1%(相对降低10.4%)。进一步分析显示,所提方法对快速适应未见过的说话人-环境条件具有潜力。
引用
@article{arxiv.2306.14608,
title = {Factorised Speaker-environment Adaptive Training of Conformer Speech Recognition Systems},
author = {Jiajun Deng and Guinan Li and Xurong Xie and Zengrui Jin and Mingyu Cui and Tianzi Wang and Shujie Hu and Mengzhe Geng and Xunying Liu},
journal= {arXiv preprint arXiv:2306.14608},
year = {2023}
}
备注
Accepted by INTERSPEECH 2023