通过偏好对齐提升跨领域零样本文本到语音的清晰度
声音
2025-06-09 v2 音频与语音处理
摘要
现代零样本文本到语音(TTS)系统尽管使用了大规模预训练,但在诸如绕口令、重复词、语码转换和跨语言合成等挑战性场景中仍常遇到困难,导致清晰度问题。为解决这些局限,本文利用偏好对齐技术,该技术能够定向构建预训练分布之外的数据以提升性能。我们引入了一个名为清晰度偏好语音数据集(INTP)的新数据集,并扩展了直接偏好优化(DPO)框架以适应多种TTS架构。经过INTP对齐后,除了清晰度,我们还观察到多个TTS模型在跨域场景下的自然度、相似度和音频质量等整体指标的提升。基于此,我们还验证了INTP对更清晰模型(如CosyVoice 2和Ints)的弱到强泛化能力。此外,我们展示了通过基于Ints的迭代对齐实现进一步改进的潜力。音频样本可在https://intalign.github.io/获取。
引用
@article{arxiv.2505.04113,
title = {Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment},
author = {Xueyao Zhang and Yuancheng Wang and Chaoren Wang and Ziniu Li and Zhuo Chen and Zhizheng Wu},
journal= {arXiv preprint arXiv:2505.04113},
year = {2025}
}
备注
Accepted by ACL 2025