中文

利用人类反馈增强零样本文本转语音合成

计算与语言 2024-06-04 v1 声音 音频与语音处理

摘要

近年来,文本转语音(TTS)技术取得了令人瞩目的进步,特别是利用大规模训练数据集,展现了人类水平的语音质量和对未见说话者令人印象深刻的零样本能力。然而,尽管人类主观评价(如平均意见得分(MOS))仍然是评估合成语音质量的黄金标准,但即使是最先进的TTS方法也一直将人类反馈与训练隔离开来,导致训练目标和评估指标不匹配。在这项工作中,我们研究了一个新颖的主题:将主观人类评估整合到TTS训练循环中。受近期人类反馈强化学习成功的启发,我们提出了一个专门为TTS优化量身定制的综合采样-标注-学习框架,即不确定性感知优化(UNO)。具体来说,UNO无需奖励模型或偏好数据,通过直接最大化语音生成的效用,同时考虑主观人类语音感知和评估中固有可变性所蕴含的不确定性。主观和客观评估的实验结果表明,UNO在MOS、词错误率和说话人相似度方面显著提高了TTS模型的零样本性能。此外,我们展示了UNO的一个显著能力:它可以无缝且灵活地适应情感TTS中所需的说话风格。

关键词

引用

@article{arxiv.2406.00654,
  title  = {Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback},
  author = {Chen Chen and Yuchen Hu and Wen Wu and Helin Wang and Eng Siong Chng and Chao Zhang},
  journal= {arXiv preprint arXiv:2406.00654},
  year   = {2024}
}

备注

19 pages, Preprint