中文

VIP5:面向推荐系统的多模态基础模型

信息检索 2023-10-17 v2 人工智能 人机交互 机器学习 多媒体

摘要

计算机视觉(CV)、自然语言处理(NLP)和推荐系统(RecSys)是三个重要的人工智能应用,传统上各自独立发展,导致了不同的建模与工程方法。这阻碍了这些领域直接相互借鉴进展的能力。随着基础模型的最近发展,大语言模型已成为统一不同模态与问题表述的潜在通用接口。有鉴于此,我们提出在 P5 推荐范式下考虑视觉、文本与个性化模态的多模态基础模型(MFM),并命名为 VIP5(Visual P5),以统一多种模态与推荐任务。这将使得在共享架构中处理多模态以提升推荐效果。为此,我们引入多模态个性化提示,以在共享格式下容纳多种模态。此外,我们提出一种面向基础模型的参数高效训练方法,该方法冻结 P5 主干并微调轻量适配器,从而在训练时间与内存使用方面提升推荐性能与效率。VIP5 的代码与数据可在 https://github.com/jeykigung/VIP5 获取。

关键词

引用

@article{arxiv.2305.14302,
  title  = {VIP5: Towards Multimodal Foundation Models for Recommendation},
  author = {Shijie Geng and Juntao Tan and Shuchang Liu and Zuohui Fu and Yongfeng Zhang},
  journal= {arXiv preprint arXiv:2305.14302},
  year   = {2023}
}

备注

Accepted by EMNLP 2023