基于大语言模型的推荐系统数据高效微调
信息检索
2024-06-05 v2
摘要
利用大语言模型(LLMs)进行推荐近来引起了广泛关注,其中微调在 LLMs 的适配中起着关键作用。然而,在快速增长的推荐数据上微调 LLMs 的成本限制了其实际应用。为应对这一挑战,少样本微调为快速将 LLMs 适配到新的推荐数据提供了一种有前景的方法。我们提出了面向高效 LLM 推荐的数据剪枝任务,旨在识别适合 LLMs 少样本微调的代表性样本。虽然核心集选择与所提任务密切相关,但现有的核心集选择方法通常依赖于次优的启发式度量,或在大规模推荐数据上产生高昂的优化成本。为解决这些问题,我们为 LLM 推荐背景下的数据剪枝任务引入两个目标:1) 高精度,旨在识别能带来高整体性能的有影响力样本;2) 高效率,强调数据剪枝过程的低成本。为追求这两个目标,我们提出了一种基于两个分数(即影响力分数和难度分数)的新型数据剪枝方法,以高效识别有影响力的样本。特别地,引入影响力分数以准确估计移除样本对整体性能的影响。为实现数据剪枝过程的低成本,我们使用一个小型代理模型替代 LLMs 来获取影响力分数。考虑到代理模型与 LLMs 之间的潜在差距,我们进一步提出难度分数,以专门为 LLMs 优先考虑部分困难样本。在三个真实世界数据集上的实证结果验证了所提方法的有效性。特别是,所提方法仅使用 2% 的样本就超越了全数据微调,并将时间成本降低了 97%。
引用
@article{arxiv.2401.17197,
title = {Data-efficient Fine-tuning for LLM-based Recommendation},
author = {Xinyu Lin and Wenjie Wang and Yongqi Li and Shuo Yang and Fuli Feng and Yinwei Wei and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2401.17197},
year = {2024}
}
备注
Accepted by SIGIR 2024