中文

基于细粒度AI反馈提升文本到音频生成基本能力

声音 2025-05-16 v1 音频与语音处理

摘要

文本到音频(T2A)生成在生成多样化音频输出方面取得了显著进展。然而,当前最先进的T2A模型在处理复杂多事件音频时,仍难以满足人类对提示跟随和声学质量的需求。为提升模型在这些高级应用中的表现,我们提出通过AI反馈学习来增强模型的基本能力。首先,我们引入细粒度AI音频评分管道:1)验证文本提示中每个事件是否出现在音频中(事件发生得分),2)检测事件序列是否偏离语言描述(事件序列得分),3)评估生成音频的整体声学和和声质量(声学与和声质量)。我们评估了这三个自动评分管道,发现它们与人类偏好之间的相关性显著高于其他评估指标。这凸显了它们作为反馈信号和评估指标的价值。利用我们稳健的评分管道,我们构建了一个大型音频偏好数据集T2A-FeedBack,包含4.1万个提示和24.9万段音频,每个都伴随详细得分。此外,我们引入T2A-EpicBench,一个聚焦长标题、多事件和叙事场景的基准,旨在评估T2A模型的先进能力。最后,我们展示了T2A-FeedBack如何提升当前最先进的音频模型。通过简单的偏好调优,音频生成模型在简单场景(AudioCaps测试集)和复杂场景(T2A-EpicBench)中均实现显著提升。

关键词

引用

@article{arxiv.2505.10561,
  title  = {T2A-Feedback: Improving Basic Capabilities of Text-to-Audio Generation via Fine-grained AI Feedback},
  author = {Zehan Wang and Ke Lei and Chen Zhu and Jiawei Huang and Sashuai Zhou and Luping Liu and Xize Cheng and Shengpeng Ji and Zhenhui Ye and Tao Jin and Zhou Zhao},
  journal= {arXiv preprint arXiv:2505.10561},
  year   = {2025}
}

备注

ACL 2025