中文

文本即所需:利用可控语音合成实现 ASR 模型个性化

音频与语音处理 2023-03-28 v1 机器学习 声音

摘要

由于个性化数据的稀缺,将通用语音识别模型适配到特定个体是一项具有挑战性的问题。近期工作提出使用个性化文本到语音合成来增加训练数据量。在此,我们针对该策略提出两个基本问题:合成数据何时对个性化有效,以及为何在那些情况下有效?为回答第一个问题,我们将一个最先进的自动语音识别(ASR)模型适配到来自四个代表不同说话人类型的基准数据集的目标说话人。我们表明,使用合成数据的 ASR 个性化在所有情况下都有效,但当(i)目标说话人在全局数据中代表性不足,以及(ii)全局模型的容量有限时尤为有效。为回答第二个关于个性化合成数据为何有效的问题,我们使用可控语音合成生成具有不同风格和内容的语音。令人惊讶的是,我们发现合成数据的文本内容而非风格对说话人适配至关重要。这些结果促使我们提出一种基于语音内容的 ASR 个性化数据选择策略。

关键词

引用

@article{arxiv.2303.14885,
  title  = {Text is All You Need: Personalizing ASR Models using Controllable Speech Synthesis},
  author = {Karren Yang and Ting-Yao Hu and Jen-Hao Rick Chang and Hema Swetha Koppula and Oncel Tuzel},
  journal= {arXiv preprint arXiv:2303.14885},
  year   = {2023}
}

备注

ICASSP 2023