中文

Sketch2Sound:基于时变信号和声学模仿的可控音频生成

声音 2025-04-15 v2 音频与语音处理

摘要

我们提出了 Sketch2Sound,这是一款能够从一组可解释的时变控制信号(声音强度、亮度和音调)以及文本提示中生成高质量音频的生成模型。Sketch2Sound 能够从声学模仿(即人声模仿或参考声音-形状)合成任意声音。Sketch2Sound 可部署在任何基于文本到音频潜在扩散变换器(DiT)之上,仅需 40k 步的微调以及每个控制信号的一个线性层,因而比现有方法如 ControlNet 更轻量。为从类似草图的声学模仿生成, 我们提出在训练期间对控制信号应用随机中值滤波,使 Sketch2Sound 能够使用具有灵活时间特定性的控制信号进行提示。我们展示,Sketch2Sound 能够从人声模仿中合成遵循输入控制精神的声音,同时保持对输入文本提示和音频质量的一致性,相较于仅基于文本的基线模型效果更佳。Sketch2Sound 使声音艺术家能够创建具有文本提示语义灵活性以及声学手势或人声模仿表达性和精确性的声音。音频示例可在 https://hugofloresgarcia.art/sketch2sound/ 查看。

关键词

引用

@article{arxiv.2412.08550,
  title  = {Sketch2Sound: Controllable Audio Generation via Time-Varying Signals and Sonic Imitations},
  author = {Hugo Flores García and Oriol Nieto and Justin Salamon and Bryan Pardo and Prem Seetharaman},
  journal= {arXiv preprint arXiv:2412.08550},
  year   = {2025}
}