中文

SAO-Instruct:基于自然语言指令的自由形式音频编辑

声音 2025-10-28 v1 机器学习

摘要

生成模型在从简短文本描述合成高保真音频方面取得了显著进展。然而,使用自然语言编辑现有音频的研究仍相对不足。当前方法要么需要完整描述编辑后的音频,要么受限于预定义的编辑指令,缺乏灵活性。本文介绍了 SAO-Instruct,一种基于 Stable Audio Open capable 的模型,能够使用任何自由形式的自然语言指令编辑音频片段。为训练本模型,我们构建了一个音频编辑三元组数据集(输入音频、编辑指令、输出音频),采用 Prompt-to-Prompt、DDPM 反向扩散和手动编辑管道。虽然部分基于合成数据进行训练,但我们的模型对真实野外音频片段和未见的编辑指令具有良好的泛化能力。我们展示了 SAO-Instruct 在客观指标上表现出竞争力,并在主观听感研究中超越了其他音频编辑方法。为鼓励未来研究,我们发布了代码和模型权重。

关键词

引用

@article{arxiv.2510.22795,
  title  = {SAO-Instruct: Free-form Audio Editing using Natural Language Instructions},
  author = {Michael Ungersböck and Florian Grötschla and Luca A. Lanzendörfer and June Young Yi and Changho Choi and Roger Wattenhofer},
  journal= {arXiv preprint arXiv:2510.22795},
  year   = {2025}
}

备注

Accepted at NeurIPS 2025