BATON:利用人类偏好反馈对齐文本到音频模型
声音
2024-02-02 v1 计算与语言
音频与语音处理
摘要
随着人工智能生成内容(AIGC)的发展,文本到音频模型正受到广泛关注。然而,由于自然语言固有的信息密度和模型理解能力的限制,这些模型难以生成与人类偏好一致的音频。为了缓解这一问题,我们提出了BATON,一个旨在利用人类偏好反馈增强生成音频与文本提示之间对齐的框架。我们的BATON包含三个关键阶段:首先,我们整理了一个包含提示和相应生成音频的数据集,然后基于人类反馈进行标注。其次,我们利用构建的数据集引入了一个奖励模型,该模型通过为输入的文本-音频对分配奖励来模拟人类偏好。最后,我们使用奖励模型微调一个现成的文本到音频模型。实验结果表明,我们的BATON在音频完整性、时间关系以及与人类偏好对齐方面,能够显著提高原始文本到音频模型的生成质量。
引用
@article{arxiv.2402.00744,
title = {BATON: Aligning Text-to-Audio Model with Human Preference Feedback},
author = {Huan Liao and Haonan Han and Kai Yang and Tianjiao Du and Rui Yang and Zunnan Xu and Qinmei Xu and Jingquan Liu and Jiasheng Lu and Xiu Li},
journal= {arXiv preprint arXiv:2402.00744},
year = {2024}
}