中文

音乐期望的深度生成模型

声音 2023-10-06 v1 机器学习 音频与语音处理

摘要

一种关于音乐情感反应的著名理论围绕 surprisal(惊奇度)与 expectation(期望)的概念展开。在先前工作中,该思想已被具体化为音乐的概率模型,其允许在给定先前音乐或文化经验的“训练集”条件下精确计算歌曲(或逐音符)概率。然而迄今为止,这些模型受限于通过手工特征计算精确概率,或局限于线性模型,而后者可能不足以表示音乐中存在的复杂条件分布。在这项工作中,我们提出以扩散模型形式的现代深度概率生成模型来计算音乐输入序列的近似似然。与先前工作不同,这种由深度神经网络参数化的生成模型能够直接从训练集本身学习复杂的非线性特征。由此,我们期望发现此类模型能更准确地表示人类听众的音乐“surprisal”。从文献可知,surprisal 与人类受试者对给定歌曲“喜欢”程度之间存在倒 U 形关系。在这项工作中,我们展示了预训练扩散模型确实产生与测得受试者“喜好”评分呈负二次关系的音乐 surprisal 值,且该关系质量与 IDyOM 等最先进方法具有竞争力。因此我们提出该模型是开发现代音乐期望与主观喜好深度生成模型的初步步骤。

关键词

引用

@article{arxiv.2310.03500,
  title  = {Deep Generative Models of Music Expectation},
  author = {Ninon Lizé Masclef and T. Anderson Keller},
  journal= {arXiv preprint arXiv:2310.03500},
  year   = {2023}
}