中文

TTSOps:面向从暗数据训练多说话人TTS模型的闭环语料优化框架

声音 2025-11-12 v3

摘要

本文提出TTSOps,一个用于从噪声、未精心整理的网络大规模语音数据(常称为“暗数据”,如在线视频)中构建多说话人文本语音合成(TTS)系统的全自动闭环框架。传统TTS训练流程需要高质量的语料库,具备良好的声学质量和准确的文本-语音对齐,这严重限制了规模、说话人多样性和实际应用性。虽然近期研究提出了基于声学质量的数据选择技术,但往往忽视了两个关键方面:(1)现代TTS模型对噪声的内在鲁棒性;(2)尽管感知质量较低但仍具信息价值的样本的潜在贡献。为此,TTSOps引入数据中心训练管道,集成三个核心组件:(1)从暗数据源自动收集数据;(2)基于训练数据质量的 utterance 级别动态选择数据清洗方法;(3)利用自动预测的平均意见分数(MOS)进行循环内评估,以估计每个utterance对模型性能的影响。此外,TTSOps以闭环框架方式联合优化语料库和TTS模型,通过动态适应目标TTS模型的特征来调整数据选择和数据清洗过程。大量实验在日本YouTube数据上表明,TTSOps在语音自然度和说话人多样性方面均优于传统基于声学质量的基线方法。

关键词

引用

@article{arxiv.2506.15614,
  title  = {TTSOps: A Closed-Loop Corpus Optimization Framework for Training Multi-Speaker TTS Models from Dark Data},
  author = {Kentaro Seki and Shinnosuke Takamichi and Takaaki Saeki and Hiroshi Saruwatari},
  journal= {arXiv preprint arXiv:2506.15614},
  year   = {2025}
}

备注

Accepted to IEEE Transactions on Audio, Speech and Language Processing