基于超图强化学习的对话推荐分层策略学习
信息检索
2023-07-27 v2
摘要
对话推荐系统(CRS)旨在通过对话及时主动地获取用户动态偏好属性以进行物品推荐。在 CRS 的每一轮中,自然存在两个角色不同且相互影响的决策过程:1)指导者(director),选择更有助于缩减动作空间并获取用户偏好的后续选项(即询问或推荐);2)执行者(actor),相应选择满足用户偏好的基本动作(即询问属性或推荐物品)并给出反馈以评估指导者选项的有效性。然而,现有方法严重依赖统一决策模块或启发式规则,忽视区分不同决策过程的角色及其相互影响。为此,我们提出一种新颖的指导者-执行者分层对话推荐器(DAHCR),其中指导者选择最有效选项,随后执行者相应选择满足用户偏好的基本动作。具体而言,我们构建动态超图建模用户偏好,并引入内在动机以从对指导者的弱监督中学习。最后,为缓解模型偏差对指导者与执行者相互影响的不良影响,我们通过从分类分布采样来建模指导者选项。大量实验表明 DAHCR 优于最先进方法。
引用
@article{arxiv.2305.02575,
title = {Towards Hierarchical Policy Learning for Conversational Recommendation with Hypergraph-based Reinforcement Learning},
author = {Sen Zhao and Wei Wei and Yifan Liu and Ziyang Wang and Wendi Li and Xian-Ling Mao and Shuai Zhu and Minghui Yang and Zujie Wen},
journal= {arXiv preprint arXiv:2305.02575},
year = {2023}
}