中文

EAT:用于自监督语音识别的增强型 ASR-TTS

音频与语音处理 2021-04-16 v1 人工智能 机器学习 声音

摘要

自监督 ASR-TTS 模型在域外数据条件下表现不佳。本文提出一种增强型 ASR-TTS(EAT)模型,其包含两个主要特性:1) ASR→TTS 方向配备语言模型奖励,用于在将 ASR 假设转发给 TTS 之前对其进行惩罚。2) 在 TTS→ASR 方向,引入一个超参数来缩放来自合成语音的注意力上下文,之后再送入 ASR 以处理域外数据。在域外数据条件下探讨了 EAT 模型的训练策略与有效性。结果表明,EAT 在 Librispeech 和 BABEL 上分别将监督与自监督训练之间的性能差距显著缩小了绝对值 2.6% 和 2.7%。

关键词

引用

@article{arxiv.2104.07474,
  title  = {EAT: Enhanced ASR-TTS for Self-supervised Speech Recognition},
  author = {Murali Karthick Baskar and Lukáš Burget and Shinji Watanabe and Ramon Fernandez Astudillo and Jan "Honza'' Černocký},
  journal= {arXiv preprint arXiv:2104.07474},
  year   = {2021}
}