受计划指导:基于引导解码提高自回归文本到音频生成的忠实度
计算与语言
2026-01-22 v1 声音
音频与语音处理
摘要
自回归(AR)模型通过顺序生成标记在生成时序连贯的音频方面表现突出,但在忠实地遵循复杂文本提示方面常常走样,尤其是那些描述复杂声音事件的提示。我们发现 AR 音频生成器的一个惊人能力:其早期前缀标记隐式地编码了最终输出的全局语义属性,如事件数量和声音-对象类别,揭示了一种形式的隐式规划。基于这一洞见,我们提出了 Plan-Critic,一种基于广义优势估计(GAE)启发的目标训练的轻量级辅助模型,用于预测部分生成的最终指令遵循质量。在推理时,Plan-Critic 启用了受引导的探索:它早期评估候选前缀,修剪低保真轨迹,并将计算资源重新分配给高潜力的规划种子。我们的 Plan-Critic 指导采样在 AR 基线上实现了最高可达 10 分的 CLAP 分数提升——在 AR 文本到音频生成中树立了新的最佳状态——同时保持与标准最佳-N 解码的计算性价值。本工作填补了因果生成与全局语义对齐之间的鸿沟,展示了即使是严格的自回归模型也能提前规划。
引用
@article{arxiv.2601.14304,
title = {Guided by the Plan: Enhancing Faithful Autoregressive Text-to-Audio Generation with Guided Decoding},
author = {Juncheng Wang and Zhe Hu and Chao Xu and Siyue Ren and Yuxiang Feng and Yang Liu and Baigui Sun and Shujun Wang},
journal= {arXiv preprint arXiv:2601.14304},
year = {2026}
}
备注
Accepted at EACL 2026