基于元学习模型重初始化的改进端到端构音障碍语音识别
音频与语音处理
2020-11-04 v1
摘要
构音障碍语音识别是一项具有挑战性的任务,因为构音障碍数据有限且其声学特征与正常语音存在显著偏差。基于模型的说话人自适应是一种有前景的方法,它利用有限的构音障碍语音对从大量正常语音预训练得到的基模型进行微调,以获得说话人相关模型。然而,正常语音与构音障碍语音数据之间的统计分布失配限制了基模型的自适应性能。为解决该问题,我们提出通过元学习重初始化基模型以获得更好的模型初始化。具体而言,我们关注端到端模型,并扩展模型无关元学习(MAML)与 Reptile 算法,通过反复模拟对不同构音障碍说话人的自适应来元更新基模型。由此,重初始化后的模型获得了构音障碍语音知识,并学会了如何以改进的性能对未见过的构音障碍说话人执行快速自适应。在 UASpeech 数据集上的实验结果表明,采用所提方法的最佳模型相较于未微调的基模型和直接从基模型微调的模型,分别实现了 54.2% 和 7.6% 的相对词错误率降低,并且与最先进的混合 DNN-HMM 模型相当。
引用
@article{arxiv.2011.01686,
title = {Improved End-to-End Dysarthric Speech Recognition via Meta-learning Based Model Re-initialization},
author = {Disong Wang and Jianwei Yu and Xixin Wu and Lifa Sun and Xunying Liu and Helen Meng},
journal= {arXiv preprint arXiv:2011.01686},
year = {2020}
}
备注
To appear in ISCSLP2021