SCORE: 利用标准化复合奖励扩展音频生成
音频与语音处理
2025-09-25 v1
摘要
本论文旨在提升推理阶段的文本到音频生成效果,重点是生成与文本提示精确对齐的逼真音频。尽管技术发展迅速,现有模型往往无法在感知质量与文本对齐之间取得可靠平衡。为解决这一问题,我们采用推理时扩展(Inference-Time Scaling),这是一种通过增加推理计算来提升性能的无训练优化方法。我们建立了其在音频生成中尚未被探索的应用,并提出了一种新型多奖励引导机制,使感知中的每个关键组成部分得到同等程度的体现。通过将每个奖励值归一化到统一尺度并进行加权求和,该方法不仅保证了稳定的引导效果,还实现了对目标方面的显式控制。此外,我们引入了一种基于音频语言模型的新型音频-文本对齐指标,用于更稳健的评估。实验结果表明,我们的方法在语义对齐和感知质量两方面均有所提升,显著优于朴素生成和现有的奖励引导技术。合成样本可在我们的演示页面获取:https://mm.kaist.ac.kr/projects/score
引用
@article{arxiv.2509.19831,
title = {SCORE: Scaling audio generation using Standardized COmposite REwards},
author = {Jaemin Jung and Jaehun Kim and Inkyu Shin and Joon Son Chung},
journal= {arXiv preprint arXiv:2509.19831},
year = {2025}
}