Just Ask for Music (JAM):自然语言音乐推荐的多模态与个人化
信息检索
2025-07-22 v1 机器学习
摘要
自然语言界面为音乐推荐提供了引人入胜的方法,使用户能够以对话方式表达复杂偏好。虽然大型语言模型(LLM)在这一方向表现前景所谊,但其在推荐系统中的可扩展性受到高成本和延迟的限制。使用较小的语言模型的检索方法可以缓解这些问题,但往往依赖单模态项目表示,忽略长期用户偏好,并需要完整模型重新训练,给实际部署带来挑战。在本文中,我们提出了 JAM(Just Ask for Music),一个轻量且直观的自然语言音乐推荐框架。JAM 将用户查询-项目互动建模为共享潜在空间中的向量平移,灵感来自 TransE 等知识图谱嵌入方法。为了捕捉音乐和用户意图的复杂性,JAM 通过跨注意力和稀疏混合专家聚合多模态项目特征。我们还引入了 JAMSessions,一个包含 10 万多个用户查询-项目三元组的数据集,独特地结合了对话查询和用户长期偏好。我们的结果表明,JAM 提供了准确的推荐,产生适用于实际应用场景的直观表示,并且可以轻松集成到现有的音乐推荐堆栈中。
引用
@article{arxiv.2507.15826,
title = {Just Ask for Music (JAM): Multimodal and Personalized Natural Language Music Recommendation},
author = {Alessandro B. Melchiorre and Elena V. Epure and Shahed Masoudian and Gustavo Escobedo and Anna Hausberger and Manuel Moussallam and Markus Schedl},
journal= {arXiv preprint arXiv:2507.15826},
year = {2025}
}