DLPO:面向文本到语音扩散模型的损失引导强化学习微调
机器学习
2024-11-19 v2 人工智能
摘要
近期生成模型的发展在机器学习社区中引发了广泛关注。特别是,扩散模型在合成图像和语音方面展现了卓越的能力。Lee等人(2023)、Black等人(2023)、Wang等人(2023)和Fan等人(2024)等研究表明,基于人类反馈的强化学习(RLHF)可以增强扩散模型用于图像合成。然而,由于这些模型与语音合成所采用的模型架构不同,是否能够类似地受益于RLHF以增强语音合成模型仍不明确。本文探索了将RLHF实际应用于基于扩散的文本到语音合成,利用来自UTokyo-SaruLab MOS预测系统(Saeki等人,2022)预测的意见得分(MOS)作为代理损失。我们引入扩散模型损失引导RL策略优化(DLPO),并将其与其他RLHF方法进行比较,采用NISQA语音质量和自然性评估模型(Mittag等人,2021)和人类偏好实验进行进一步评估。我们的结果表明,RLHF可以增强基于扩散的文本到语音合成模型,而且,DLPO能够更好地提高扩散模型在生成自然和高质量语音音频方面的性能。
引用
@article{arxiv.2405.14632,
title = {DLPO: Diffusion Model Loss-Guided Reinforcement Learning for Fine-Tuning Text-to-Speech Diffusion Models},
author = {Jingyi Chen and Ju-Seung Byun and Micha Elsner and Andrew Perrault},
journal= {arXiv preprint arXiv:2405.14632},
year = {2024}
}