利用音频语言模型引导音频编辑
声音
2025-09-29 v1 人工智能
机器学习
音频与语音处理
摘要
音频编辑在 VR/AR 沉浸感、虚拟会议、声音设计和其他交互媒体中扮演着核心角色。然而,近期的生成式音频编辑模型依赖于模板化的指令格式,且仅限于单声道音频。这些模型无法处理声明式音频编辑,即用户声明期望的结果,而将编辑操作的细节交由系统处理。我们引入了 SmartDJ,一个用于立体声音频编辑的新框架,它结合了音频语言模型的推理能力与 latent diffusion 的生成能力。给定一个高层指令,SmartDJ 将其分解为一系列原子编辑操作,如添加、移除或在空间上重新定位事件。这些操作随后由一个经过训练以处理立体声音频的 diffusion 模型执行。为此,我们设计了一个数据合成流水线,生成高层指令、原子编辑操作以及每次编辑操作前后的音频配对示例。实验表明,与先前的音频编辑方法相比,SmartDJ 在感知质量、空间真实感和语义对齐方面取得了更优的表现。演示可在 https://zitonglan.github.io/project/smartdj/smartdj.html 获取。
引用
@article{arxiv.2509.21625,
title = {Guiding Audio Editing with Audio Language Model},
author = {Zitong Lan and Yiduo Hao and Mingmin Zhao},
journal= {arXiv preprint arXiv:2509.21625},
year = {2025}
}