中文

基于置信度评分的 Conformer 说话人自适应语音识别

音频与语音处理 2022-06-27 v1 声音

摘要

自动语音识别(ASR)系统的一个关键挑战是建模说话人层面的差异性。本文使用紧凑的说话人相关学习隐单元贡献(LHUC)来促进最先进的基于 Conformer 的端到端 ASR 系统的说话人自适应训练(SAT)与测试时无监督说话人自适应。通过使用基于置信度评分选择更“可信”的说话人特定数据子集,降低了自适应过程中对监督错误率的敏感性。使用置信度估计模块在作为置信度评分之前平滑过度自信的 Conformer 解码器输出概率。由说话人级数据选择导致的增加的数据稀疏性通过使用 LHUC 参数的贝叶斯估计来解决。在 300 小时 Switchboard 语料库上的实验表明,所提出的带基于置信度评分的测试时无监督自适应的 LHUC-SAT Conformer 在 NIST Hub5'00、RT02 和 RT03 评测集上分别比基线说话人无关及 i-vector 自适应 Conformer 系统的词错误率(WER)绝对降低达 1.0%、1.0% 和 1.2%(相对降低 9.0%、7.9% 和 8.9%)。在使用外部 Transformer 和 LSTM 语言模型进行重打分后,一致的性能提升得以保持。

关键词

引用

@article{arxiv.2206.12045,
  title  = {Confidence Score Based Conformer Speaker Adaptation for Speech Recognition},
  author = {Jiajun Deng and Xurong Xie and Tianzi Wang and Mingyu Cui and Boyang Xue and Zengrui Jin and Mengzhe Geng and Guinan Li and Xunying Liu and Helen Meng},
  journal= {arXiv preprint arXiv:2206.12045},
  year   = {2022}
}

备注

It's accepted to INTERSPEECH 2022. arXiv admin note: text overlap with arXiv:2206.11596