自然场景下的文本到语音合成
音频与语音处理
2025-06-03 v2 人工智能
摘要
传统的文本到语音系统依赖于在受控环境中录制的录音室品质语音。最近,出现了一种被称为噪声 TTS 训练的努力,旨在利用自然场景数据。然而,缺乏专用数据集一直是一个重大限制。我们引入了公开可用的 TTS In the Wild 数据集,该数据集通过应用于 VoxCeleb1 数据集的全自动流程创建。它包含两个训练集:TITW-Hard,源自原始 VoxCeleb1 数据的转录、分割和选择;以及 TITW-Easy,它结合了基于 DNSMOS 的额外增强和数据选择。最先进的 TTS 模型在 TITW-Easy 上实现了超过 3.0 的 UTMOS 分数,而 TITW-Hard 仍然困难,显示 UTMOS 低于 2.8。
引用
@article{arxiv.2409.08711,
title = {Text-To-Speech Synthesis In The Wild},
author = {Jee-weon Jung and Wangyou Zhang and Soumi Maiti and Yihan Wu and Xin Wang and Ji-Hoon Kim and Yuta Matsunaga and Seyun Um and Jinchuan Tian and Hye-jin Shim and Nicholas Evans and Joon Son Chung and Shinnosuke Takamichi and Shinji Watanabe},
journal= {arXiv preprint arXiv:2409.08711},
year = {2025}
}
备注
5 pages, Interspeech 2025