中文

MusicSem:来自 Reddit 的自然音乐描述的语义丰富语言-音频数据集

多媒体 2026-02-23 v1 声音 音频与语音处理

摘要

音乐表示学习是音乐信息检索和生成的核心。尽管近期多模态学习的进展提高了文本与音频之间的对齐,但现有模型往往难以捕捉用户在自然语言音乐描述中所表达的意图。这一观察表明,用于训练和评估这些模型的数据集未能完全反映人类通过其自然语言形式描述音乐的更广泛和更自然的语言表达。本文中,我们引入了 MusicSem,一个包含 32,493 个语言-音频对的数据集,源自社交媒体平台 Reddit 上的有机音乐相关讨论。与现有数据集相比,MusicSem 捕捉了更广泛的音乐语义,反映了听众以细致入微和以人为中心的方式描述音乐的自然方式。为结构化这些表达,我们提出了五个语义类别的分类:描述性、气氛、情境、元数据相关和情境。除了数据的构建、分析和发布外,我们使用该数据集评估了广泛的多模态模型进行检索和生成,凸显了建模细粒度语义的重要性。总体而言,MusicSem 为支持人类对齐的多模态音乐表示学习提供了一种新型语义感知资源。

关键词

引用

@article{arxiv.2602.17769,
  title  = {MusicSem: A Semantically Rich Language--Audio Dataset of Natural Music Descriptions},
  author = {Rebecca Salganik and Teng Tu and Fei-Yueh Chen and Xiaohao Liu and Keifeng Lu and Ethan Luvisia and Zhiyao Duan and Guillaume Salha-Galvan and Anson Kahng and Yunshan Ma and Jian Kang},
  journal= {arXiv preprint arXiv:2602.17769},
  year   = {2026}
}