ConceptCaps:一个用于音乐模型可解释性的精炼概念数据集
声音
2026-02-05 v3 人工智能
机器学习
摘要
像 TCAV 这样的基于概念的可解释性方法需要为每个概念提供干净、分离良好的正例和负例。现有的音乐数据集缺乏这种结构:标签稀疏、嘈杂或定义不清。我们引入了 ConceptCaps,一个包含 21,000 个音乐-描述-标签三元组的数据集,具有来自 200 个属性分类法的明确标签。我们的流程将语义建模与文本生成分离:变分自编码器(VAE)学习合理的属性共现模式,微调后的大语言模型(LLM)将属性列表转换为专业描述,MusicGen 合成相应的音频。这种分离相比端到端方法提高了连贯性和可控性。我们通过音频-文本对齐(CLAP)、语言质量指标(BERTScore、MAUVE)和 TCAV 分析验证了该数据集,确认概念探针恢复了具有音乐意义的模式。数据集和代码可在线获取。
引用
@article{arxiv.2601.14157,
title = {ConceptCaps: a Distilled Concept Dataset for Interpretability in Music Models},
author = {Bruno Sienkiewicz and Łukasz Neumann and Mateusz Modrzejewski},
journal= {arXiv preprint arXiv:2601.14157},
year = {2026}
}