面向 ASR 训练增强的文本到语音数据筛选
音频与语音处理
2023-06-05 v1 计算与语言
声音
摘要
本文提出一种从给定大型文本到语音(TTS)数据集中筛选合适合成语音样本以作为自动语音识别(ASR)模型补充训练数据的方法。我们训练了一个可用交叉熵损失或 Arcface 损失优化的神经网络,以度量合成数据与真实语音的相似度。我们发现,将因词汇差异等在部分上而与真实语音差异显著的合成样本纳入 ASR 训练,对提升识别性能至关重要。在 Librispeech 测试集上的实验结果表明,为保持与使用全部 TTS 数据相同的语音识别精度,我们所提方案能将 TTS 数据规模缩减至其 以下,优于若干基线方法。
关键词
引用
@article{arxiv.2306.00998,
title = {Towards Selection of Text-to-speech Data to Augment ASR Training},
author = {Shuo Liu and Leda Sarı and Chunyang Wu and Gil Keren and Yuan Shangguan and Jay Mahadeokar and Ozlem Kalinli},
journal= {arXiv preprint arXiv:2306.00998},
year = {2023}
}