中文

细粒度偏好优化提升零样文本到语音

音频与语音处理 2025-12-29 v2 声音

摘要

将人类反馈整合到文本到语音(TTS)系统输出中以与人类偏好一致,已被证明是增强基于语言模型的TTS系统鲁棒性的有效方法。当前方法主要关注以说话单元水平标注的偏好数据。然而,影响听觉体验的常见问题往往只在音频样本的特定片段中出现,而其他片段则表现良好。本研究提出了一种细粒度偏好优化方法(FPO),以增强TTS系统的鲁棒性。FPO侧重于解决生成样本中的局部问题,而不是对整个说话单元进行统一优化。具体而言,我们首先分析生成样本中的问题类型,将其分为两组,并提出基于每种问题类型的细粒度标签的选择性训练损失策略以优化偏好。实验结果表明,FPO通过有效解决局部问题,显著降低了差 cases 的比例,提高了可理解性。此外,FPO在数据效率方面优于基线系统,以更少的训练样本实现类似性能。

关键词

引用

@article{arxiv.2502.02950,
  title  = {Fine-grained Preference Optimization Improves Zero-shot Text-to-Speech},
  author = {Jixun Yao and Yuguang Yang and Yu Pan and Yuan Feng and Ziqian Ning and Jianhao Ye and Hongbin Zhou and Lei Xie},
  journal= {arXiv preprint arXiv:2502.02950},
  year   = {2025}
}

备注

Accepted By IEEE TASLP