IISAN:高效适配解耦 PEFT 的多模态序列推荐表示
信息检索
2024-07-23 v3 计算机视觉与模式识别
摘要
多模态基础模型在序列推荐系统中具有变革性,利用强大的表示学习能力。虽然参数高效微调(PEFT)常用于为推荐任务适配基础模型,但大多数研究侧重参数效率,往往忽视关键因素如 GPU 内存效率和训练速度。为填补这一差距,我们的论文引入 IISAN(基于 intra- 和 inter-modal 侧适配的网络,用于多模态表示),这是一种简单易插拔的体系结构,采用解耦 PEFT 结构并利用 intra- 和 inter-modal 适配。IISAN 能匹配全参数微调(FFT)和最先进的 PEFT 的性能。更重要的是,它显著减少了 GPU 内存使用——从 47GB 降至仅 3GB 用于多模态序列推荐任务。此外,它将每个 epoch 的训练时间从 FFT 的 443 秒缩短至 22 秒。与 Adapter 和 LoRA 等方法相比,后者需要 37-39 GB GPU 内存和 350-380 秒每个 epoch 的训练时间。 Furthermore, 我们提出了一种新的复合效率指标 TPME(训练时间、参数和 GPU 内存效率),以缓解“参数效率代表整体效率”的普遍误解。TPME 为不同方法的实际效率比较提供了更全面的见解。此外,我们对所有 PEFT 和 FFT 方法进行了可及的效率分析,显示 IISAN 的优越性。我们在 https://github.com/GAIR-Lab/IISAN 上发布了代码和其他材料。
引用
@article{arxiv.2404.02059,
title = {IISAN: Efficiently Adapting Multimodal Representation for Sequential Recommendation with Decoupled PEFT},
author = {Junchen Fu and Xuri Ge and Xin Xin and Alexandros Karatzoglou and Ioannis Arapakis and Jie Wang and Joemon M. Jose},
journal= {arXiv preprint arXiv:2404.02059},
year = {2024}
}
备注
Accepted by SIGIR2024