使用 Transformer 自编码器进行合成器预设插值
声音
2023-03-10 v2 机器学习
音频与语音处理
摘要
声音合成器在现代音乐制作中十分普及,但掌握它们日益需要专家技能。本工作关注于预设之间的插值,即所有声音合成参数值组成的集合,以实现从现有声音直观创建新声音。我们引入了一种双模态自编码器神经网络,它同时使用多头注意力块处理预设、使用卷积处理音频。该模型已在一个拥有百余参数的流行调频合成器上进行了测试。实验将该模型与相关架构和方法进行了比较,并证明其实现了更平滑的插值。训练后,所提出的模型可集成到商业合成器中,用于实时插值或声音设计任务。
引用
@article{arxiv.2210.16984,
title = {Synthesizer Preset Interpolation using Transformer Auto-Encoders},
author = {Gwendal Le Vaillant and Thierry Dutoit},
journal= {arXiv preprint arXiv:2210.16984},
year = {2023}
}
备注
Accepted to IEEE ICASSP 2023