SynthCloner:基于因子化编解码器的合成器风格音频迁移与 ADSR 包络控制
音频与语音处理
2026-02-02 v2 声音
摘要
电子合成器声音由参数设置控制,具有复杂的 timbral 特征和 ADSR 包络,使得合成器风格音频迁移尤其具有挑战性。近期方法通常依赖谱目标或隐式风格匹配,对包络 shaping 控制有限。此外,公开合成器数据集很少提供 timbre 和 ADSR 包络的多样覆盖。为此,我们提出 SynthCloner,一种因子化编解码器模型,将音频解耦为三个属性:ADSR 包络、timbre 与 content。这种分离使音频迁移能够独立控制这些属性。此外,我们引入 SynthCAT,一个新型合成器数据集,包含 250 种 timbre、120 个 ADSR 包络和 100 个 MIDI 序列的任务专用渲染管道。实验表明,SynthCloner 在客观和主观指标上均优于基线方法,并实现了独立属性控制。代码、模型检查点及音频示例已发布于 https://buffett0323.github.io/synthcloner/。
引用
@article{arxiv.2509.24286,
title = {SynthCloner: Synthesizer-style Audio Transfer via Factorized Codec with ADSR Envelope Control},
author = {Jeng-Yue Liu and Ting-Chao Hsu and Yen-Tung Yeh and Li Su and Yi-Hsuan Yang},
journal= {arXiv preprint arXiv:2509.24286},
year = {2026}
}
备注
ICASSP 2026