基于专家网络的会话式推荐系统强化策略优化
计算与语言
2025-10-02 v2
摘要
会话式推荐系统(CRSs)旨在通过与用户的多轮自然语言交互提供个性化推荐。鉴于大型语言模型(LLMs)强大的交互和推理能力,利用 LLMs 构建 CRSs 最近已成为一个有前景的方向。然而,现有的基于 LLM 的方法通常缺乏对交互策略的显式优化,而是依赖统一的提示词和 LLM 的内部知识来决定如何交互,这可能导致次优结果。在本文中,我们提出了一种用于 CRS 的新型强化策略优化(RSO)方法,该方法通过专家网络架构将生成策略驱动的响应决策过程分解为宏观策略规划和微观策略适应。在宏观层面,规划器专家选择宏观交互策略(例如,推荐、解释、鼓励)。在微观层面,执行器专家在所选的宏观策略条件下生成详细响应,并由提供互补信息(如用户偏好和事实依据)的辅助专家指导。这种分层分解解开了 CRS 响应生成中涉及的不同子任务的优化,使得每个层面的学习更易处理。为了解决高质量多轮训练数据的稀缺问题,我们将策略学习表述为强化学习问题,在基于 LLM 的奖励模型的指导下实现自动策略探索。大量实验表明,与最先进的基线相比,RSO 显著提高了交互性能,证明了显式分层策略优化对 CRS 的有效性。
引用
@article{arxiv.2509.26093,
title = {Reinforced Strategy Optimization for Conversational Recommender Systems via Network-of-Experts},
author = {Xiaoyan Zhao and Ming Yan and Yang Zhang and Yang Deng and Jian Wang and Fengbin Zhu and Yilun Qiu and Hong Cheng and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2509.26093},
year = {2025}
}