中文

STTATTS:统一的语音识别与语音合成模型

计算与语言 2024-10-25 v1 人工智能 机器学习 声音 音频与语音处理

摘要

语音识别和语音合成模型通常分别进行训练,每个模型都有自己的一组学习目标、训练数据和模型参数,导致两个独立的大型网络。我们提出了一种通过多任务学习目标和共享参数来联合学习 ASR 和 TTS 的参数高效方法。我们的评估表明,多任务模型的性能相当于分别训练的模型,同时显著节省了计算和内存成本(约减少 50\% 的两个任务所需的总参数数)。我们使用英语作为资源丰富的语言,阿拉伯语作为相对资源较少的语言(因缺乏 TTS 数据)。我们的模型使用公开数据训练,训练代码和模型检查点均公开可用,以便进一步研究。

关键词

引用

@article{arxiv.2410.18607,
  title  = {STTATTS: Unified Speech-To-Text And Text-To-Speech Model},
  author = {Hawau Olamide Toyin and Hao Li and Hanan Aldarmaki},
  journal= {arXiv preprint arXiv:2410.18607},
  year   = {2024}
}

备注

11 pages, 4 Figures, EMNLP 2024 Findings