用于对话式推荐系统中以隐式用户反馈为导向的 LLM 对齐的 RLHF 精调
机器学习
2025-08-08 v1
摘要
基于大型语言模型(LLM)的对话式推荐系统(CRS)需要不断地与用户偏好保持一致,以提供满足且与上下文相关的物品推荐。传统的监督式精调无法捕获隐式反馈信号,例如停留时间、情感极性或参与度模式。本文分享一种使用人类反馈强化学习(RLHF)以最大化隐式用户反馈(IUF)来进行精调的解决方案,适用于多轮推荐情境。我们指定一个在弱标记参与度信息上学习的奖励模型 ,通过采用近端策略优化(PPO)方法来最大化以用户为中心的效用,以优化基础 LLM 。该体系结构模型对话状态转换 ,其中动作 仅在过去对话历史的条件下与 LLM 生成的物品建议相关联。跨合成数据集和真实世界数据集(如 REDIAL、OpenDialKG)的评估表明,我们的 RLHF 精调模型在 top- 推荐准确度、连贯性和用户满意度方面均优于(arrow-zero-cmwrquca-teja-falset ensuite 2Round group-deca States penalty give up)该论文表明,隐式信号对齐在实现可扩展且用户自适应的 CRS 设计方面是高效的。
引用
@article{arxiv.2508.05289,
title = {RLHF Fine-Tuning of LLMs for Alignment with Implicit User Feedback in Conversational Recommenders},
author = {Zhongheng Yang and Aijia Sun and Yushang Zhao and Yinuo Yang and Dannier Li and Chengrui Zhou},
journal= {arXiv preprint arXiv:2508.05289},
year = {2025}
}