对抗自编码器中具有音乐条件化的辅助声音样本生成
声音
2019-06-25 v2 机器学习
音频与语音处理
摘要
生成模型在计算机视觉中蓬勃发展,实现了前所未有的图像处理。然而音频方面的成果仍较不成熟。我们的项目目标是从一组缩减的高层参数进行实时声音合成,包括可适配不同声音库与特定标签的语义控制。这些生成变量应允许对目标音乐品质的表现力调制,并连续混合为新的风格。为此,我们在管弦乐器的单音符样本数据库上训练自编码器(AE),连同其内在属性:音符类别、音色域与扩展演奏技法。我们对解码器进行条件化以控制渲染音符属性,并使用潜对抗训练来学习最终可混合的表现力风格参数。我们评估了生成性能与潜表示。我们的消融研究证明了音乐条件化机制的有效性。所提模型从任意概率潜码样本生成幅度谱图形式的音符,并具有对管弦音色与演奏风格的表现力控制。其训练数据子集可直接在 3D 潜表示中可视化。波形渲染可离线用 GLA 完成。为允许实时交互,我们用预训练 MCNN 微调解码器,并将完整波形生成流水线嵌入插件中。此外编码器可用于处理新输入样本,在操控其潜属性表示后,解码器可生成样本变体,如同音频效果一般。我们的方案训练相当快速,可直接应用于其他声音域,包括带有可映射至特定生成控制的自定义声音标签的用户库。因此,它促进了创造力与直观的音频风格实验。
引用
@article{arxiv.1904.06215,
title = {Assisted Sound Sample Generation with Musical Conditioning in Adversarial Auto-Encoders},
author = {Adrien Bitton and Philippe Esling and Antoine Caillon and Martin Fouilleul},
journal= {arXiv preprint arXiv:1904.06215},
year = {2019}
}
备注
this article has been accepted for presentation to the 22nd International Conference on Digital Audio Effects (DAFx 2019) ; we provide additional content on this companion repository https://github.com/acids-ircam/Expressive_WAE_FADER