中文

Rec-GPT4V:基于大型视觉语言模型的多模态推荐

人工智能 2024-02-14 v1

摘要

大型视觉语言模型(LVLMs)的发展为解决传统多模态推荐所面临的挑战提供了潜力,主要得益于其对静态图像和文本动态的高效理解能力。然而,由于LVLMs缺乏用户偏好知识(其训练源自海量通用数据集),以及在处理离散、噪声和冗余图像序列时面临多图像动态问题,LVLMs在该领域的应用仍受限。为此,我们提出了一种新颖的推理方案Rec-GPT4V,核心为视觉-摘要思维(Visual-Summary Thought, VST),以利用大型视觉语言模型实现多模态推荐。我们将用户历史记录作为上下文中的用户偏好,以解决第一个问题。随后,我们引导LVLMs生成物品图像摘要,并结合物品标题在自然语言空间中的图像理解能力,对候选物品的用户偏好进行查询。我们在四个数据集上进行了全面实验,评估了三种LVLMs:GPT4-V、LLaVa-7b和LLaVa-13b。数值结果表明VST的有效性。

关键词

引用

@article{arxiv.2402.08670,
  title  = {Rec-GPT4V: Multimodal Recommendation with Large Vision-Language Models},
  author = {Yuqing Liu and Yu Wang and Lichao Sun and Philip S. Yu},
  journal= {arXiv preprint arXiv:2402.08670},
  year   = {2024}
}

备注

under review