中文

Audio Palette:基于多信号条件的扩散 Transformer 用于可控 Foley 合成

声音 2025-12-09 v4 音频与语音处理

摘要

近期进展表明,基于扩散的生成模型已实现高质量文本到音频合成,但在开源研究中实现细粒度声学控制仍是一大挑战。我们提出 Audio Palette,一个基于扩散 Transformer (DiT) 的模型,将 Stable Audio Open 架构扩展以解决可控音频生成中的此“控制差距”。不同于依赖单一语义条件的先前方法,Audio Palette 引入四个随时间变化的控制信号:loudness、pitch、spectral centroid 和 timbre,以实现对声学特征的精确和可解释的操控。该模型通过在精选的 AudioSet 子集上应用低秩适应 (LoRA) 高效适配 Foley 合成领域,仅需训练原始参数的 0.85%。实验表明,Audio Palette 实现了声学属性的细粒度、可解释控制。关键在于,它在保持高音频质量和与文本提示强语义对齐的同时,实现了新颖的可控性,其在 FAD 和 LAION-CLAP 等标准指标上的性能保持与原始基线模型相当。我们提供了一个可扩展、模块化的音频研究管道,强调基于序列的条件、内存效率以及用于精细推理时控制的三尺度 classifier-free guidance 机制。本工作为开源环境下的可控声设计和表演性音频合成奠定了坚实基础,使更具艺术性的工作流程得以在更广泛的音乐和声信息检索上下文中实现。

关键词

引用

@article{arxiv.2510.12175,
  title  = {Audio Palette: A Diffusion Transformer with Multi-Signal Conditioning for Controllable Foley Synthesis},
  author = {Junnuo Wang},
  journal= {arXiv preprint arXiv:2510.12175},
  year   = {2025}
}

备注

Accepted for publication in the Artificial Intelligence Technology Research (AITR)