面向列表化推荐的层次化强化学习时间抽象化
信息检索
2025-07-22 v2 人工智能
机器学习
摘要
现代列表化推荐系统需要同时考虑长期用户感知与短期兴趣变化。强化学习可用于推荐系统中研究此类问题,但也面临大范围搜索空间、稀疏用户反馈以及长交互延迟。基于近期在层次化强化学习方面的进展,我们提出了一种新型框架,称为 mccHRL,用于为列表化推荐提供不同的时间抽象层次。在该层次框架中,高级代理研究用户感知的演化,而低级代理通过将过程建模为顺序决策问题来产生物品选择策略。我们认为,这种框架具有明确的幕后情境和日内情境的分解,分别由高级代理和低级代理编码。为验证此论点,我们实现了基于模拟器的环境和基于工业数据集的实验。结果表明,我们的方法相对于多个著名基准方法在性能上具有显著提升。数据和代码已公开。
引用
@article{arxiv.2409.07416,
title = {Hierarchical Reinforcement Learning for Temporal Abstraction of Listwise Recommendation},
author = {Luo Ji and Gao Liu and Mingyang Yin and Hongxia Yang and Jingren Zhou},
journal= {arXiv preprint arXiv:2409.07416},
year = {2025}
}
备注
18 pages, 4 figures