中文

三模态融合:利用大语言模型对齐视觉、文本与图数据以实现多行为推荐

信息检索 2025-02-18 v2 人工智能 计算与语言

摘要

整合多样化数据模态对于提升个性化推荐系统的性能至关重要。传统模型往往依赖单一数据源,难以准确捕捉物品特征和用户行为的多维本质。本文引入一种新型框架,用于多行为推荐,利用通过大语言模型(LLM)对齐融合三模态数据,包括视觉、文本与图数据。通过纳入视觉信息,我们捕捉物品的语境与审美特征;文本数据提供用户兴趣与物品特征的详细洞见;图数据阐明了物品-行为异构图中的关系。我们提出的模型称为三模态融合(Triple Modality Fusion, TMF),运用LLM的能力对齐集成这三种模态,实现对用户行为的全面表征。LLM建模用户的交互行为及物品特征。初始阶段,仅使用基于自然语言的提示词对LLM进行热身。随后,我们基于跨注意力与自注意力机制设计了模态融合模块,将不同模型的不同模态整合到同一嵌入空间,并纳入LLM。大量实验表明,我们的方法在提升推荐准确性方面具有显著效果。进一步的消融研究验证了我们模型设计的有效性及TMF的各项益处。

关键词

引用

@article{arxiv.2410.12228,
  title  = {Triple Modality Fusion: Aligning Visual, Textual, and Graph Data with Large Language Models for Multi-Behavior Recommendations},
  author = {Luyi Ma and Xiaohan Li and Zezhong Fan and Kai Zhao and Jianpeng Xu and Jason Cho and Praveen Kanumala and Kaushiki Nag and Sushant Kumar and Kannan Achan},
  journal= {arXiv preprint arXiv:2410.12228},
  year   = {2025}
}