中文

用于对话式推荐系统中以隐式用户反馈为导向的 LLM 对齐的 RLHF 精调

机器学习 2025-08-08 v1

摘要

基于大型语言模型(LLM)的对话式推荐系统(CRS)需要不断地与用户偏好保持一致,以提供满足且与上下文相关的物品推荐。传统的监督式精调无法捕获隐式反馈信号,例如停留时间、情感极性或参与度模式。本文分享一种使用人类反馈强化学习(RLHF)以最大化隐式用户反馈(IUF)来进行精调的解决方案,适用于多轮推荐情境。我们指定一个在弱标记参与度信息上学习的奖励模型 RϕR_{\phi},通过采用近端策略优化(PPO)方法来最大化以用户为中心的效用,以优化基础 LLM MθM_{\theta}。该体系结构模型对话状态转换 statst+1s_t \to a_t \to s_{t+1},其中动作 ata_t 仅在过去对话历史的条件下与 LLM 生成的物品建议相关联。跨合成数据集和真实世界数据集(如 REDIAL、OpenDialKG)的评估表明,我们的 RLHF 精调模型在 top-kk 推荐准确度、连贯性和用户满意度方面均优于(arrow-zero-cmwrquca-teja-falset ensuite 2Round group-deca States penalty give up)该论文表明,隐式信号对齐在实现可扩展且用户自适应的 CRS 设计方面是高效的。

关键词

引用

@article{arxiv.2508.05289,
  title  = {RLHF Fine-Tuning of LLMs for Alignment with Implicit User Feedback in Conversational Recommenders},
  author = {Zhongheng Yang and Aijia Sun and Yushang Zhao and Yinuo Yang and Dannier Li and Chengrui Zhou},
  journal= {arXiv preprint arXiv:2508.05289},
  year   = {2025}
}