AudioEditor:基于扩散模型的无训练音频编辑框架
声音
2024-10-01 v2 音频与语音处理
摘要
基于扩散的文本到音频(TTA)生成取得了显著进展,利用潜在扩散模型(LDM)产生高质量、多样且与指令相关的音频。然而,除生成外,音频编辑任务同样重要,但获得的关注相对较少。音频编辑任务面临两个主要挑战:执行精确编辑和保留未编辑的部分。虽然基于 LDM 的工作流程在图像处理领域有效解决了这些挑战,但此类方法在音频编辑方面的应用仍寥寥。本文引入 AudioEditor,一个建立在预训练扩散 TTA 模型之上的无训练音频编辑框架。AudioEditor 集成了 Null-text Inversion 和 EOT-suppression 方法,使模型能够在执行精确编辑的同时保留原始音频特征。全面的客观和主观实验验证了 AudioEditor 在提供高质量音频编辑方面的有效性。代码和演示可在 https://github.com/NKU-HLT/AudioEditor 查看。
关键词
引用
@article{arxiv.2409.12466,
title = {AudioEditor: A Training-Free Diffusion-Based Audio Editing Framework},
author = {Yuhang Jia and Yang Chen and Jinghua Zhao and Shiwan Zhao and Wenjia Zeng and Yong Chen and Yong Qin},
journal= {arXiv preprint arXiv:2409.12466},
year = {2024}
}