Tango 2:通过直接偏好优化对齐基于扩散的文本到音频生成
声音
2024-07-18 v4 人工智能
计算与语言
音频与语音处理
摘要
生成式多模态内容在许多内容创作领域日益普及,因为它有潜力让艺术家和媒体人员通过快速将想法具象化来创建预制作模型。在音乐和电影行业中,从文本提示生成音频是此类过程的一个重要方面。最近许多基于扩散的文本到音频模型专注于在大型提示-音频对数据集上训练日益复杂的扩散模型。这些模型并未明确关注输出音频中概念或事件的存在及其相对于输入提示的时间顺序。我们的假设是,关注音频生成的这些方面可以在数据有限的情况下提高音频生成性能。因此,在本研究中,我们使用现有的文本到音频模型 Tango,合成创建了一个偏好数据集,其中每个提示都有一个获胜音频输出和若干失败音频输出供扩散模型学习。理论上,失败输出在提示中缺失了某些概念或顺序不正确。我们在偏好数据集上使用 diffusion-DPO(直接偏好优化)损失对公开可用的 Tango 文本到音频模型进行微调,并表明在自动评估和人工评估指标上,其音频输出均优于 Tango 和 AudioLDM2。
引用
@article{arxiv.2404.09956,
title = {Tango 2: Aligning Diffusion-based Text-to-Audio Generations through Direct Preference Optimization},
author = {Navonil Majumder and Chia-Yu Hung and Deepanway Ghosal and Wei-Ning Hsu and Rada Mihalcea and Soujanya Poria},
journal= {arXiv preprint arXiv:2404.09956},
year = {2024}
}
备注
Accepted at ACM MM 2024