中文

基于频率加权方法和伪耳语预训练的端到端耳语识别

计算与语言 2020-11-10 v2 声音 音频与语音处理

摘要

耳语是人类语音的一种重要模式,但目前尚未有关于其端到端识别结果的报道,这可能是由于可用的耳语语音数据稀缺。在本文中,考虑到耳语的特殊性和数据的稀缺性,我们提出了几种用于耳语端到端识别的方法。这包括一种频率加权的 SpecAugment 策略和一个频率分割的 CNN 特征提取器,以更好地捕捉耳语的高频结构,以及一种逐层迁移学习方法,先用正常语音或正常转耳语的语音预训练模型,然后用耳语语音进行微调,以弥合耳语和正常语音之间的差距。我们在一个相对较小的耳语 TIMIT 语料库上实现了音素错误率总体相对降低 19.8% 和字符错误率总体相对降低 44.4%。结果表明,只要我们有一个在正常或伪耳语语音上预训练好的良好端到端模型,一个相对较小的耳语语音集可能就足以获得一个相当好的端到端耳语识别器。

关键词

引用

@article{arxiv.2005.01972,
  title  = {End-to-end Whispered Speech Recognition with Frequency-weighted Approaches and Pseudo Whisper Pre-training},
  author = {Heng-Jui Chang and Alexander H. Liu and Hung-yi Lee and Lin-shan Lee},
  journal= {arXiv preprint arXiv:2005.01972},
  year   = {2020}
}

备注

Accepted to IEEE SLT 2021