通过自监督表示混合与嵌入初始化最大化跨语言 TTS 适配的数据效率
计算与语言
2024-02-06 v1 机器学习
摘要
本文提出了一种有效的迁移学习框架,用于文本转语音 (TTS) 系统的语言适配,重点在于使用最少的标注和未标注数据实现语言适配。虽然许多工作专注于减少标注数据的使用,但很少有工作考虑最小化未标注数据的使用。通过在预训练阶段利用自监督特征,在微调阶段用这些特征替换伪标签中的噪声部分,并结合嵌入初始化技巧,我们的方法相比传统方法从未标注数据中利用了更多信息。实验结果表明,我们的框架能够仅使用 4 句标注数据和 15 分钟未标注数据合成未见语言的可理解语音。即使有更多数据可用,我们的方法仍继续超越传统技术。这些发现突显了我们数据高效语言适配框架的潜力。
引用
@article{arxiv.2402.01692,
title = {Maximizing Data Efficiency for Cross-Lingual TTS Adaptation by Self-Supervised Representation Mixing and Embedding Initialization},
author = {Wei-Ping Huang and Sung-Feng Huang and Hung-yi Lee},
journal= {arXiv preprint arXiv:2402.01692},
year = {2024}
}
备注
Accepted by ASRU 2023