利用多模态大语言模型实现多模态序列推荐
信息检索
2025-01-14 v5 人工智能
摘要
大语言模型(LLM)在推荐系统(RS)领域展现了显著潜力。大多数现有研究侧重于将用户行为日志转换为文本提示,并利用提示调优等技术使 LLM 适用于推荐任务。与此同时,利用模态融合技术整合图像、文本和其他来源数据的多模态推荐系统研究兴趣最近不断增长。这为现有仅依赖文本模态信息的基于 LLM 的推荐范式引入了新的挑战。此外,虽然已经出现了能够处理多模态输入的多模态大语言模型(MLLM),但如何赋予 MLLM 多模态推荐能力仍然 largely 未被探索。为此,在本文中,我们提出了多模态大语言模型增强的多模态序列推荐(MLLM-MSR)模型。为捕捉动态用户偏好,我们设计了一种两阶段用户偏好摘要方法。具体而言,我们首先利用基于 MLLM 的物品摘要器提取给定物品的图像特征并将图像转换为文本。然后,我们采用基于 LLM 的用户摘要器的循环用户偏好摘要生成范式来捕捉用户偏好的动态变化。最后,为使 MLLM 能够执行多模态推荐任务,我们提出使用监督微调(SFT)技术对基于 MLLM 的推荐器进行微调。在各种数据集上的广泛评估验证了 MLLM-MSR 的有效性,展现了其在捕捉和适应用户偏好演变动态方面的卓越能力。
引用
@article{arxiv.2408.09698,
title = {Harnessing Multimodal Large Language Models for Multimodal Sequential Recommendation},
author = {Yuyang Ye and Zhi Zheng and Yishan Shen and Tianshu Wang and Hengruo Zhang and Peijun Zhu and Runlong Yu and Kai Zhang and Hui Xiong},
journal= {arXiv preprint arXiv:2408.09698},
year = {2025}
}