探索生成式 AI 如何解读音乐
声音
2023-08-02 v1 机器学习
音频与语音处理
摘要
我们使用 Google 的 MusicVAE——一种具有 512 维潜空间、用于表示若干小节音乐的变分自编码器,并根据潜维度在描述音乐中的相关性对其进行组织。我们发现,平均而言,当输入真实音乐片段时,大多数潜神经元保持静默:我们称之为"噪声"神经元。其余几十个确实激活的潜神经元被称为"音乐"神经元。我们探究哪些神经元承载音乐信息,以及它们编码了何种音乐信息,即可被识别为音高、节奏或旋律的内容。我们发现,关于音高和节奏的大部分信息编码于前几个音乐神经元中:该神经网络由此构造了若干变量,以非线性方式编码了许多用于描述音高与节奏的人定义变量。旋律的概念似乎仅在较长音乐序列的独立神经元中显现。
引用
@article{arxiv.2308.00015,
title = {Exploring how a Generative AI interprets music},
author = {Gabriela Barenboim and Luigi Del Debbio and Johannes Hirn and Veronica Sanz},
journal= {arXiv preprint arXiv:2308.00015},
year = {2023}
}
备注
16 pages, 12 figures