RecLLM-R1:基于强化学习和链律推理 v1 的双阶段训练范式
人工智能
2025-06-25 v1
摘要
传统的推荐系统常面临“过滤气泡”问题、外部知识利用不足以及模型优化与业务策略迭代之间存在断层。为解决这些局限性,本文引入 RecLLM-R1,一种基于大型语言模型(LLM)的新颖推荐框架,灵感来自 DeepSeek R1 方法。该框架首先通过精心设计的数据构造过程,将用户画像、历史交互和多方面物品属性转换为 LLM 可解释的自然语言提示。随后,采用双阶段训练范式:初始阶段使用监督微调(SFT)为 LLM 注入基本推荐能力;后续阶段利用基于组相对策略优化(GRPO)的强化学习技术,结合链律推理(CoT)机制。该阶段通过灵活定义的奖励函数引导模型进行多步骤推理和全局决策,旨在同时优化推荐准确度、多样性及其他定制化业务目标。在来自大型社交媒体平台的真实用户行为数据集上进行的经验评估表明,RecLLM-R1 在准确度、多样性和新颖性等多个评估指标上显著优于现有基线方法。它有效缓解了过滤气泡效应,为在复杂业务目标下实现推荐模型与策略的集成优化提供了可行路径。
引用
@article{arxiv.2506.19235,
title = {RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1},
author = {Yu Xie and Xingkai Ren and Ying Qi and Yao Hu and Lianlei Shan},
journal= {arXiv preprint arXiv:2506.19235},
year = {2025}
}