估计音频中的音乐惊喜度
声音
2025-01-14 v1 人工智能
音频与语音处理
摘要
在用计算方法建模音乐惊喜预期时,已有研究提出使用自回归模型的一步预测的信息内容(IC)作为符号音乐中惊喜的代理。通过适当选择的模型,音乐事件的IC已被证明与人类对惊喜和复杂性方面(包括音调和节奏复杂性)的感知相关。本研究探讨是否可以将类似的方法应用于音乐音频。我们训练一个自回归Transformer模型来预测预训练自编码器网络的压缩潜在音频表示。我们通过估计重复时IC的下降来验证学习效果。我们研究了音乐片段类型(例如A或B)的平均IC,发现出现在乐曲后面的片段类型平均IC高于前面的片段。我们研究了IC与音频和音乐特征的关系,发现它与音色变化和响度相关,其次是与不协和度、节奏复杂性和起始密度相关。最后,我们研究了IC是否可以预测对歌曲的EEG反应,从而模拟人类对音乐的惊喜。我们在github.com/sonycslparis/audioic上提供了我们方法的代码。
引用
@article{arxiv.2501.07474,
title = {Estimating Musical Surprisal in Audio},
author = {Mathias Rose Bjare and Giorgia Cantisani and Stefan Lattner and Gerhard Widmer},
journal= {arXiv preprint arXiv:2501.07474},
year = {2025}
}
备注
5 pages, 2 figures, 1 table. Accepted at the 2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP 2025), Hyderabad, India