MusiCRS:以音频为中心的对话式推荐基准
声音
2026-01-26 v2 多媒体
摘要
对话式推荐系统借助大语言模型(LLMs)发展迅速,然而音乐仍是一个独特且具有挑战性的领域,因为有效的推荐需要对音频内容进行推理,而这超出了文本或元数据所能捕捉的范围。我们提出了MusiCRS,这是首个以音频为中心的对话式推荐基准,它将来自Reddit的真实用户对话与相应的曲目关联起来。MusiCRS包含477个高质量对话,涵盖多种音乐流派(古典、嘻哈、电子、金属、流行、独立、爵士),涉及3,589个独特的音乐实体,并通过YouTube链接提供音频基础。MusiCRS支持在三种输入模态配置下进行评估:仅音频、仅查询以及音频+查询,从而能够系统性地比较音频大语言模型(audio-LLMs)、检索模型和传统方法。我们的实验表明,当前系统在跨模态整合方面存在困难,最优性能常出现在单模态设置而非多模态配置中。这凸显了跨模态知识整合的根本性局限,即模型擅长处理对话语义,但在将抽象的音乐概念与音频建立联系时却遇到困难。为了推动进展,我们发布了MusiCRS数据集(https://huggingface.co/datasets/rohan2810/MusiCRS)、评估代码(https://github.com/rohan2810/musiCRS)以及全面的基线。
引用
@article{arxiv.2509.19469,
title = {MusiCRS: Benchmarking Audio-Centric Conversational Recommendation},
author = {Rohan Surana and Amit Namburi and Gagan Mundada and Abhay Lal and Zachary Novack and Julian McAuley and Junda Wu},
journal= {arXiv preprint arXiv:2509.19469},
year = {2026}
}
备注
5 pages