GRAM:用于基于内容的协同过滤的预训练语言模型快速微调
计算与语言
2022-11-23 v2 人工智能
信息检索
摘要
基于内容的协同过滤(CCF)基于用户交互历史与物品内容信息预测用户-物品交互。近来,预训练语言模型(PLM)已被用于为CCF提取高质量物品编码。然而,以端到端(E2E)方式训练基于PLM的CCF模型是资源密集型的,因为优化涉及通过给定用户交互序列中每个内容编码进行反向传播。为解决此问题,我们提出GRAM(CCF中多模态梯度累积,GRadient Accumulation for Multi-modality in CCF),其利用给定物品常在一批交互历史中多次出现这一事实。具体而言,单步GRAM聚合每个物品编码的梯度用于反向传播,在理论上等价于标准E2E训练。作为单步GRAM的扩展,我们提出多步GRAM,其增大梯度更新延迟,以极少GPU内存实现进一步加速。GRAM在来自知识追踪与新闻推荐两个任务领域的五个数据集上显著提升训练效率(高达146倍)。我们的代码见 https://github.com/yoonseok312/GRAM。
引用
@article{arxiv.2204.04179,
title = {GRAM: Fast Fine-tuning of Pre-trained Language Models for Content-based Collaborative Filtering},
author = {Yoonseok Yang and Kyu Seok Kim and Minsam Kim and Juneyoung Park},
journal= {arXiv preprint arXiv:2204.04179},
year = {2022}
}
备注
NAACL 2022 Main Conference (Long Paper)