中文

基于置信度评分的Conformer语音识别系统说话人自适应

音频与语音处理 2023-02-16 v1 声音

摘要

说话人自适应技术为针对个体用户定制自动语音识别(ASR)系统提供了有力方案。无监督基于模型的说话人自适应技术在实际应用于数据密集型端到端ASR系统时,受限于说话人级数据稀缺及对转写错误敏感。为解决这些问题,我们使用一组紧凑且数据高效的说话人相关(SD)参数表示,以促进最先进Conformer ASR系统的说话人自适应训练与测试时无监督说话人自适应。通过使用基于置信度评分选择错误较少的说话人级自适应数据子集,降低了对监督质量的敏感性。我们提出两个轻量级置信度评分估计模块以产生更可靠的置信度评分。由数据选择加剧的数据稀疏问题,通过贝叶斯学习对SD参数不确定性建模得以解决。在基准300小时Switchboard与233小时AMI数据集上的实验表明,所提出的基于置信度评分的自适应方案持续优于基线说话人无关(SI)Conformer模型及不使用说话人数据选择的常规非贝叶斯点估计自适应。在外接Transformer与LSTM语言模型重打分后,类似的持续性能提升得以保持。特别是在300小时Switchboard语料上,相较于基线SI Conformer,在NIST Hub5'00、RT02与RT03评估集上分别取得了1.0%、1.3%与1.4%绝对(9.5%、10.9%与11.3%相对)的 statistically significant WER降低。在AMI开发与评估集上也分别取得了2.7%与3.3%绝对(8.9%与10.2%相对)的类似WER降低。

关键词

引用

@article{arxiv.2302.07521,
  title  = {Confidence Score Based Speaker Adaptation of Conformer Speech Recognition Systems},
  author = {Jiajun Deng and Xurong Xie and Tianzi Wang and Mingyu Cui and Boyang Xue and Zengrui Jin and Guinan Li and Shujie Hu and Xunying Liu},
  journal= {arXiv preprint arXiv:2302.07521},
  year   = {2023}
}

备注

IEEE/ACM Transactions on Audio, Speech, and Language Processing