音乐风味对应的数据集归一化与感知验证
声音
2026-04-14 v1 机器学习
多媒体
音频与语音处理
摘要
收集大规模、跨模态的数据集用于音乐-风味研究困难重重,因为感知实验成本高昂且规模较小。我们通过两种互补实验来缓解这一瓶颈。第一项实验测试了从实验音乐剧集(257 条带有人类标注的曲目)将音频-风味相关性、特征重要性排序及潜在因子结构传递到大型 FMA 语料库(约 49300 条带合成标签的片段)的能力。第二项实验则将计算得到的风味目标——通过可重复的管道从食品化学中推导——针对人类感知进行验证,开展了为期 49 名听众、20 条曲目的在线听者研究。两项实验的结果趋于一致:定量传递分析确认跨模态结构在不同监督 regime 下保持一致,感知评估显示计算目标与听者评分之间存在显著关联(置换检验 p<0.0001,Mantel r=0.45,Procrustes m²=0.51)。这些发现支持了“声音调味”效应存在于合成 FMA 标注中的结论。我们发布数据集和伴随代码,以支持可重复的跨模态 AI 研究。
引用
@article{arxiv.2604.10632,
title = {Multimodal Dataset Normalization and Perceptual Validation for Music-Taste Correspondences},
author = {Matteo Spanio and Valentina Frezzato and Antonio Rodà},
journal= {arXiv preprint arXiv:2604.10632},
year = {2026}
}
备注
Submitted to SMC2026