探索用于生成音乐可解释 AI 的变分自编码器架构、配置与数据集
声音
2024-02-06 v1 人工智能
音频与语音处理
摘要
用于音乐及一般艺术的生成式 AI 模型日益复杂且难以理解。可解释 AI (XAI) 领域致力于使神经网络等复杂且不透明的 AI 模型更易于被人理解。使生成式 AI 模型更易懂的一种方法是向生成式 AI 模型施加少量语义上有意义的属性。本文系统考察了不同变分自编码器模型(MeasureVAE 与 AdversarialVAE)、AI 模型中潜空间配置(从 4 到 256 个潜维度)以及训练数据集(爱尔兰民谣、土耳其民谣、古典和流行)的组合,在生成模型被施加 2 或 4 个有意义音乐属性时对音乐生成性能的影响。迄今为止,尚无在此组合细节层面对此类模型的系统比较。我们的发现表明,MeasureVAE 比 AdversarialVAE 具有更好的重构性能,而后者具有更好的音乐属性独立性。结果显示,MeasureVAE 能够跨音乐流派生成具有可解释音乐控制维度的音乐,并在低复杂度音乐(如流行和摇滚)上表现最佳。我们建议,当使用 MeasureVAE 跨流派生成音乐时,对于 4 个正则化维度,32 或 64 个潜维度空间为最优。我们的结果是针对最先进音乐生成 AI 模型配置的首个详细比较,可用于帮助选择和配置 AI 模型、音乐特征与数据集,以实现更易理解的音乐生成。
引用
@article{arxiv.2311.08336,
title = {Exploring Variational Auto-Encoder Architectures, Configurations, and Datasets for Generative Music Explainable AI},
author = {Nick Bryan-Kinns and Bingyuan Zhang and Songyan Zhao and Berker Banar},
journal= {arXiv preprint arXiv:2311.08336},
year = {2024}
}
备注
Preprint. Springer MIR journal submission under review