EditGen:基于跨注意力控制的指令驱动自回归音频编辑
声音
2025-07-16 v1 人工智能
音频与语音处理
摘要
本研究探讨了如何利用跨注意力控制实现自回归模型中的高效音频编辑。灵感来源于图像编辑方法,我们开发了类似 Prompt-to-Prompt 的方法,通过跨注意力和自注意力机制引导编辑。我们整合了受 Auffusion 启发的扩散策略,将模型功能扩展到支持细化编辑,为提示导向音频编辑奠定基线。此外,我们引入另一种方法,通过整合 MUSICGEN(一个预训练的冻结自回归模型),并提出基于替换、重加权和精炼注意力得分的三种编辑机制。我们采用常用的音乐特定评估指标和人类研究,来衡量时变可控性、全文本线索的遵循程度以及整体音频真实性。自动评估和人类评估表明,我们提出的提示-到-提示指导与自回归生成模型的组合,在音乐旋律、动态和节奏方面显著优于基于扩散的基线。我们的代码已公开于 https://github.com/billsioros/EditGen
引用
@article{arxiv.2507.11096,
title = {EditGen: Harnessing Cross-Attention Control for Instruction-Based Auto-Regressive Audio Editing},
author = {Vassilis Sioros and Alexandros Potamianos and Giorgos Paraskevopoulos},
journal= {arXiv preprint arXiv:2507.11096},
year = {2025}
}