中文

SpeechAlign:将语音生成与人类偏好对齐

计算与语言 2024-04-09 v1 声音 音频与语音处理

摘要

语音语言模型在生成逼真语音方面取得了显著进展,其中神经编解码器语言模型表现尤为突出。然而,利用人类反馈将语音输出与人类偏好对齐的整合却常常被忽视。本文通过首先分析编解码器语言模型中的分布差距来填补这一空白,强调了该差距如何导致训练和推理阶段之间的差异,从而对性能产生负面影响。然后,我们探索利用人类反馈学习来弥合分布差距。我们引入了 SpeechAlign,这是一种将语音语言模型与人类偏好对齐的迭代自改进策略。SpeechAlign 包括构建一个偏好编解码器数据集,将标准编解码器标记与合成标记进行对比,随后进行偏好优化以改进编解码器语言模型。这一改进循环被迭代执行,以稳步将弱模型转化为强模型。通过主观和客观评估,我们表明 SpeechAlign 能够弥合分布差距并促进语音语言模型的持续自改进。此外,SpeechAlign 表现出强大的泛化能力,适用于较小的模型。代码和模型将在 https://github.com/0nutation/SpeechGPT 上提供。

关键词

引用

@article{arxiv.2404.05600,
  title  = {SpeechAlign: Aligning Speech Generation to Human Preferences},
  author = {Dong Zhang and Zhaowei Li and Shimin Li and Xin Zhang and Pengyu Wang and Yaqian Zhou and Xipeng Qiu},
  journal= {arXiv preprint arXiv:2404.05600},
  year   = {2024}
}

备注

Work in progress