基于深度学习架构的潜空间音频探索之声学设计策略
声音
2023-06-21 v2 机器学习
音频与语音处理
摘要
近年来,深度学习在声音与音乐计算中的应用研究引起了关注;然而,这些新技术如何融入现实艺术实践之间仍存在缺失环节。在本工作中,我们探索了一种称为变分自编码器(VAE)的知名深度学习架构。这些架构已用于许多领域以生成潜空间,其中数据点被组织使得相似数据点彼此靠近。先前,VAE已被用于生成潜音色空间或符号音乐片段的潜空间。将VAE应用于音色的音频特征需要声码器将网络生成的音色转换为音频信号,这在计算上开销很大。在本工作中,我们直接将VAE应用于原始音频数据,同时绕过音频特征提取。该方法允许从业者使用任何音频录音,同时通过数据集策划对美学给予灵活性与控制。音频信号生成中较低的计算时间使得原始音频方法能够被纳入实时应用。在本工作中,我们提出了三种用于声音设计应用的音频与音色潜空间探索策略。通过此举,我们的目标是在声音与音乐实践中利用潜音频空间的艺术方法与策略上发起对话。
引用
@article{arxiv.2305.15571,
title = {Sound Design Strategies for Latent Audio Space Explorations Using Deep Learning Architectures},
author = {Kıvanç Tatar and Kelsey Cotton and Daniel Bisig},
journal= {arXiv preprint arXiv:2305.15571},
year = {2023}
}
备注
In Proceedings of Sound and Music Computing 2023, ISBN 978-91-527-7372-7