中文

面向 ASR 训练增强的文本到语音数据筛选

音频与语音处理 2023-06-05 v1 计算与语言 声音

摘要

本文提出一种从给定大型文本到语音(TTS)数据集中筛选合适合成语音样本以作为自动语音识别(ASR)模型补充训练数据的方法。我们训练了一个可用交叉熵损失或 Arcface 损失优化的神经网络,以度量合成数据与真实语音的相似度。我们发现,将因词汇差异等在部分上而与真实语音差异显著的合成样本纳入 ASR 训练,对提升识别性能至关重要。在 Librispeech 测试集上的实验结果表明,为保持与使用全部 TTS 数据相同的语音识别精度,我们所提方案能将 TTS 数据规模缩减至其 30%30\,\% 以下,优于若干基线方法。

关键词

引用

@article{arxiv.2306.00998,
  title  = {Towards Selection of Text-to-speech Data to Augment ASR Training},
  author = {Shuo Liu and Leda Sarı and Chunyang Wu and Gil Keren and Yuan Shangguan and Jay Mahadeokar and Ozlem Kalinli},
  journal= {arXiv preprint arXiv:2306.00998},
  year   = {2023}
}