基于自回归扩散模型噪声空间估计音乐惊讶值
声音
2025-08-08 v1 人工智能
音频与语音处理
摘要
最近,来自生成式无限词汇 Transformer(GIVT)的预测信息内容(IC)被用于建模音乐的期望值和惊讶值。我们研究了使用基于自回归扩散模型(ADMs)计算的IC估计效果。我们经验性地表明,基于两种不同扩散常微分方程(ODEs)的模型IC估计在负对数似然度方面比GIVT更能描述多样化数据。我们评估了扩散模型IC在捕捉惊讶值方面的效果,通过两个任务来检验:(1)捕捉单音高惊讶值,(2)检测多轨音频的段落边界。在两个任务中,扩散模型的表现与或优于GIVT。我们假设,不同扩散过程噪声水平上估计的惊讶值对应于不同音频细粒度处的音乐和音频特征惊讶值。测试我们的假设,我们发现对于适当的噪声水平,所研究的音乐惊讶任务结果得到改善。代码已提供于github.com/SonyCSLParis/audioic。
引用
@article{arxiv.2508.05306,
title = {Estimating Musical Surprisal from Audio in Autoregressive Diffusion Model Noise Spaces},
author = {Mathias Rose Bjare and Stefan Lattner and Gerhard Widmer},
journal= {arXiv preprint arXiv:2508.05306},
year = {2025}
}
备注
9 pages, 1 figure, 5 tables. Accepted at the 25th International Society for Music Information Retrieval Conference (ISMIR), Daejeon, South Korea, 2025 2025