中文

IncompeBench:一个宽松许可的细粒度音乐信息检索基准

信息检索 2026-02-13 v1 人工智能

摘要

多模态信息检索近年来取得了显著进展,利用深度预训练模型日益强大的多模态能力来跨模态表示信息。特别是音乐信息检索(MIR),其质量已大幅提升,音乐的神经表示甚至已进入日常生活产品。然而,目前缺乏用于评估音乐检索性能的高质量基准。为解决此问题,我们引入了\textbf{IncompeBench},一个精心标注的基准,包含1,574个宽松许可的高质量音乐片段、500个多样化的查询以及超过125,000个独立相关性判断。这些标注是通过使用多阶段流水线创建的,导致人类标注者与生成数据之间具有高度一致性。生成的数据集可在https://huggingface.co/datasets/mixedbread-ai/incompebench-strict 和 https://huggingface.co/datasets/mixedbread-ai/incompebench-lenient 公开获取,提示词可在https://github.com/mixedbread-ai/incompebench-programs 获取。

关键词

引用

@article{arxiv.2602.11941,
  title  = {IncompeBench: A Permissively Licensed, Fine-Grained Benchmark for Music Information Retrieval},
  author = {Benjamin Clavié and Atoof Shakir and Jonah Turner and Sean Lee and Aamir Shakir and Makoto P. Kato},
  journal= {arXiv preprint arXiv:2602.11941},
  year   = {2026}
}