利用不完美合成语音进行中间微调以改善电子喉语音识别
声音
2023-05-31 v2 音频与语音处理
摘要
由于数据集较小,针对电子喉说话人的自动语音识别(ASR)系统的研究相对未被充分探索。当 ASR 缺乏训练数据时,大规模预训练与微调框架通常足以实现较高的识别率;然而,在电子喉语音中,预训练与微调数据之间的领域偏移过大而难以克服,限制了识别率的最大提升。为此,我们提出一种中间微调步骤,利用不完美合成语音来缩小预训练数据与目标数据之间的领域偏移差距。尽管合成数据不完美,我们展示了该方法在电子喉语音数据集上的有效性,相较未使用不完美合成语音的基线取得了 6.1% 的提升。结果表明,中间微调阶段侧重于学习不完美合成数据的高层固有特征,而非可懂度等低层特征。
引用
@article{arxiv.2211.01079,
title = {Intermediate Fine-Tuning Using Imperfect Synthetic Speech for Improving Electrolaryngeal Speech Recognition},
author = {Lester Phillip Violeta and Ding Ma and Wen-Chin Huang and Tomoki Toda},
journal= {arXiv preprint arXiv:2211.01079},
year = {2023}
}
备注
Accepted to ICASSP 2023