MuseChat:一种面向视频的对话式音乐推荐系统
机器学习
2024-03-12 v4 计算机视觉与模式识别
信息检索
摘要
视频的音乐推荐在多模态研究中引起日益增长关注。然而,现有系统主要关注内容兼容性,常忽略用户偏好。其无法与用户交互以进一步细化或提供解释,导致体验欠佳。我们通过 MuseChat 解决这些问题,这是一种首创的基于对话的推荐系统,为视频个性化音乐建议。我们的系统包含两个关键功能及相应模块:推荐与推理。推荐模块以视频及可选信息(包括先前建议的音乐与用户偏好)为输入,检索匹配情境的合适音乐。推理模块具备 Large Language Model(Vicuna-7B)能力并扩展至多模态输入,能为推荐音乐提供合理解释。为评估 MuseChat 有效性,我们构建了大规模数据集 conversational music recommendation for videos,基于准确的音乐曲目信息模拟用户与推荐者间的两轮交互。实验结果表明,MuseChat 相较现有基于视频的音乐检索方法取得显著改进,并具备强可解释性与可交互性。
引用
@article{arxiv.2310.06282,
title = {MuseChat: A Conversational Music Recommendation System for Videos},
author = {Zhikang Dong and Bin Chen and Xiulong Liu and Pawel Polak and Peng Zhang},
journal= {arXiv preprint arXiv:2310.06282},
year = {2024}
}