VIP5:面向推荐系统的多模态基础模型
信息检索
2023-10-17 v2 人工智能
人机交互
机器学习
多媒体
摘要
计算机视觉(CV)、自然语言处理(NLP)和推荐系统(RecSys)是三个重要的人工智能应用,传统上各自独立发展,导致了不同的建模与工程方法。这阻碍了这些领域直接相互借鉴进展的能力。随着基础模型的最近发展,大语言模型已成为统一不同模态与问题表述的潜在通用接口。有鉴于此,我们提出在 P5 推荐范式下考虑视觉、文本与个性化模态的多模态基础模型(MFM),并命名为 VIP5(Visual P5),以统一多种模态与推荐任务。这将使得在共享架构中处理多模态以提升推荐效果。为此,我们引入多模态个性化提示,以在共享格式下容纳多种模态。此外,我们提出一种面向基础模型的参数高效训练方法,该方法冻结 P5 主干并微调轻量适配器,从而在训练时间与内存使用方面提升推荐性能与效率。VIP5 的代码与数据可在 https://github.com/jeykigung/VIP5 获取。
引用
@article{arxiv.2305.14302,
title = {VIP5: Towards Multimodal Foundation Models for Recommendation},
author = {Shijie Geng and Juntao Tan and Shuchang Liu and Zuohui Fu and Yongfeng Zhang},
journal= {arXiv preprint arXiv:2305.14302},
year = {2023}
}
备注
Accepted by EMNLP 2023