AUDIT:基于潜在扩散模型按指令进行音频编辑
声音
2023-04-06 v2 人工智能
计算与语言
机器学习
音频与语音处理
摘要
音频编辑可用于多种目的,例如添加背景音效、替换乐器以及修复受损音频。近来,一些基于扩散的方法通过使用以输出音频文本描述为条件的扩散与去噪过程实现了零样本音频编辑。然而,这些方法仍存在一些问题:1)它们未在编辑任务上训练,无法保证良好的编辑效果;2)它们可能错误地修改不需要编辑的音频片段;3)它们需要输出音频的完整描述,这在实际场景中并非总是可用或必要。在本工作中,我们提出AUDIT,一种基于潜在扩散模型(latent diffusion models)的指令引导音频编辑模型。具体而言,AUDIT有三个主要设计特点:1)我们为不同音频编辑任务构建三元组训练数据(指令、输入音频、输出音频),并以指令和输入(待编辑)音频为条件、生成输出(已编辑)音频来训练扩散模型;2)它可以通过比较输入与输出音频的差异自动学习仅修改需要编辑的片段;3)它仅需编辑指令而非完整目标音频描述作为文本输入。AUDIT在多项音频编辑任务(如添加、删除、替换、修复、超分辨率)的客观与主观指标上均取得了最先进(state-of-the-art)的结果。演示样本可在 https://audit-demo.github.io/ 获取。
引用
@article{arxiv.2304.00830,
title = {AUDIT: Audio Editing by Following Instructions with Latent Diffusion Models},
author = {Yuancheng Wang and Zeqian Ju and Xu Tan and Lei He and Zhizheng Wu and Jiang Bian and Sheng Zhao},
journal= {arXiv preprint arXiv:2304.00830},
year = {2023}
}