中文

利用 DDPM 反演进行零样本无监督和基于文本的音频编辑

声音 2024-05-30 v4 机器学习 音频与语音处理

摘要

利用大型预训练模型以零样本方式编辑信号最近在图像领域取得了快速进展。然而,这一浪潮尚未波及音频领域。在本文中,我们探讨了两种使用 DDPM 反演和预训练扩散模型的音频信号零样本编辑技术。第一种,我们称之为 ZEro-shot Text-based Audio (ZETA) 编辑,是从图像领域采用的。第二种,名为 ZEro-shot UnSupervized (ZEUS) 编辑,是一种在无监督情况下发现语义上有意义的编辑方向的新方法。当应用于音乐信号时,该方法揭示了一系列具有音乐趣味的修改,从控制特定乐器的参与到旋律的即兴创作。样本和代码可在 https://hilamanor.github.io/AudioEditing/ 找到。

关键词

引用

@article{arxiv.2402.10009,
  title  = {Zero-Shot Unsupervised and Text-Based Audio Editing Using DDPM Inversion},
  author = {Hila Manor and Tomer Michaeli},
  journal= {arXiv preprint arXiv:2402.10009},
  year   = {2024}
}

备注

Accepted for ICML 2024; Examples and code available in https://hilamanor.github.io/AudioEditing/