中文

AudioMorphix:基于扩散概率模型的无训练音频编辑

音频与语音处理 2025-05-23 v1

摘要

精准编辑声音是音频内容创作中尚未充分探索的关键挑战。虽然已有工作可以通过文本指令或音频示例对进行声音编辑,但往往难以在保持原始录音保真度的同时精确修改音频内容。本文中,我们提出了一种新颖的编辑方法,能够通过直接操作频谱图来实现对特定时频区域的局部修改,同时保持音频其余部分的完整。为实现这一目标,我们提出 AudioMorphix,一种无需训练的音频编辑器,通过参考另一段录音来操控频谱图上的目标区域。灵感来自形变理论,我们将音频混合概念为不同声音通过形变无缝融合,并通过去形变分解回单个组成部分。我们的 AudioMorphix 在原始输入和参考音频条件下优化带噪声潜在表示,通过一系列能量函数纠正引导扩散过程。此外,我们通过引入缓存机制来增强自注意力层,以保留原始录音的细节特征。为推进音频编辑研究,我们设计了一个新的评估基准,包括一套包含多种编辑指令的精选数据集。广泛的实验表明,AudioMorphix 在各种音频编辑任务上均表现出色,包括添加、移除、时间偏移和拉伸、以及音调移动,实现了高保真度和高精度。演示和代码均可在本 URL 访问。

关键词

引用

@article{arxiv.2505.16076,
  title  = {AudioMorphix: Training-free audio editing with diffusion probabilistic models},
  author = {Jinhua Liang and Yuanzhe Chen and Yi Yuan and Dongya Jia and Xiaobin Zhuang and Zhuo Chen and Yuping Wang and Yuxuan Wang},
  journal= {arXiv preprint arXiv:2505.16076},
  year   = {2025}
}