将对话推荐系统重构为三相离线策略学习
信息检索
2024-09-10 v2
摘要
现有的对话推荐系统(CRS)主要利用用户模拟器进行推荐策略的训练和评估。这些模拟器往往通过仅关注静态物品属性来过度简化用户交互的复杂性,忽视了刻画真实用户行为的丰富且不断演化的偏好。这一局限性导致模型在模拟环境中表现良好,但在实际部署中却表现不佳。为应对这些挑战,本文提出了基于三相离线策略学习的对话推荐系统(TCRS),显著降低了对实时交互的依赖,并缓解了传统方法中普遍存在的过拟合问题。TCRS 将基于模型的离线学习策略与可控的用户模拟相结合,动态对齐个性化和不断演化的用户偏好。通过全面的实验,TCRS 在推荐方面展现了增强的鲁棒性、适应性和准确性,在多样化用户场景中优于传统 CRS 模型。该方法不仅提供了更真实的评估环境,还促进了对用户行为动态的深入理解,从而优化了推荐过程。
引用
@article{arxiv.2408.06809,
title = {Reformulating Conversational Recommender Systems as Tri-Phase Offline Policy Learning},
author = {Gangyi Zhang and Chongming Gao and Hang Pan and Runzhe Teng and Ruizhe Li},
journal= {arXiv preprint arXiv:2408.06809},
year = {2024}
}
备注
Accepted at CIKM 2024