STTATTS:统一的语音识别与语音合成模型
计算与语言
2024-10-25 v1 人工智能
机器学习
声音
音频与语音处理
摘要
语音识别和语音合成模型通常分别进行训练,每个模型都有自己的一组学习目标、训练数据和模型参数,导致两个独立的大型网络。我们提出了一种通过多任务学习目标和共享参数来联合学习 ASR 和 TTS 的参数高效方法。我们的评估表明,多任务模型的性能相当于分别训练的模型,同时显著节省了计算和内存成本(约减少 50\% 的两个任务所需的总参数数)。我们使用英语作为资源丰富的语言,阿拉伯语作为相对资源较少的语言(因缺乏 TTS 数据)。我们的模型使用公开数据训练,训练代码和模型检查点均公开可用,以便进一步研究。
引用
@article{arxiv.2410.18607,
title = {STTATTS: Unified Speech-To-Text And Text-To-Speech Model},
author = {Hawau Olamide Toyin and Hao Li and Hanan Aldarmaki},
journal= {arXiv preprint arXiv:2410.18607},
year = {2024}
}
备注
11 pages, 4 Figures, EMNLP 2024 Findings