Recomposer:基于事件滚动的生成式音频编辑
声音
2025-09-08 v1 人工智能
机器学习
音频与语音处理
摘要
编辑复杂真实场景中的声音较为困难,因为单个声源在时间上重叠。在生成模型中,能够基于其对数据域的强先验知识来填补丢失或损坏细节。我们提出了一个系统,能够基于文本编辑描述(例如“增强 Door”)和从“事件滚动”转换中推导出的事件时间图表示,对复杂场景中的单个声源进行删除、插入和增强编辑。我们采用在 SoundStream 表示上工作的 encoder-decoder transformer,训练其以合成 (输入, 期望输出) 音频对形式构建,合成数据由向稠密真实背景中添加孤立声源事件形成。评估结果表明,编辑描述的每个组成部分——动作、类别、时间——都至关重要。我们的工作表明“重构”是一种重要且实际的应用。
引用
@article{arxiv.2509.05256,
title = {Recomposer: Event-roll-guided generative audio editing},
author = {Daniel P. W. Ellis and Eduardo Fonseca and Ron J. Weiss and Kevin Wilson and Scott Wisdom and Hakan Erdogan and John R. Hershey and Aren Jansen and R. Channing Moore and Manoj Plakal},
journal= {arXiv preprint arXiv:2509.05256},
year = {2025}
}
备注
5 pages, 5 figures