深度学习文本到语音模型在少样本、低资源、定制化数据集上迁移学习的比较分析
声音
2023-10-10 v1 人工智能
计算与语言
音频与语音处理
摘要
基于深度学习的文本到语音(TTS)合成依赖于语音质量。现代 TTS 模型虽先进,但需要大量数据。鉴于这些模型日益增长的计算复杂性与大规模高质量数据集的稀缺,本研究聚焦于迁移学习,尤其是少样本、低资源和定制化数据集上的迁移学习。本研究中,“低资源”特指训练数据量有限的情境,例如某一语言或方言仅有少量音频录音及对应转写文本。本论文根植于对所需 TTS 模型的迫切需求:训练时间更短、数据样本更少,却能产出高质量语音输出。研究通过详尽的技术分析评估了 TTS 最先进模型的迁移学习能力,进而开展实操实验分析以比较模型在受限数据集上的表现。本研究考察了现代 TTS 系统在专用数据集上结合迁移学习的有效性,以及一种平衡训练效率与合成质量的模型。初始假设表明,迁移学习可显著提升 TTS 模型在紧凑数据集上的性能,且可能存在适用于此类独特条件的最优模型。本论文预测,随着数据稀缺加剧,TTS 中迁移学习将增多。未来,定制化 TTS 应用将偏好针对特定数据集优化的模型,而非通用的数据密集型模型。
引用
@article{arxiv.2310.04982,
title = {Comparative Analysis of Transfer Learning in Deep Learning Text-to-Speech Models on a Few-Shot, Low-Resource, Customized Dataset},
author = {Ze Liu},
journal= {arXiv preprint arXiv:2310.04982},
year = {2023}
}
备注
86 pages, Bachelor's thesis, 34 figures