中文

面向会话推荐的批约束分布强化学习

机器学习 2020-12-17 v1 信息检索

摘要

现有多数用于会话推荐的深度强化学习(RL)方法要么依赖与真实用户的昂贵在线交互,要么依赖潜在有偏的基于规则或数据驱动的用户行为模型进行学习。本文转而关注纯批或离线设定下的推荐策略学习,即仅从离线历史交互日志或由未知且次优行为策略生成的批数据学习策略,而无须进一步访问真实世界数据或用户行为模型。我们提出 BCD4Rec:面向会话推荐的批约束分布 RL。BCD4Rec 建立在近期批(离线)RL 与分布 RL 的进展之上,从离线日志中学习,同时应对因潜在兴趣偏好(环境)各异而致的用户奖励固有随机性。我们证明,BCD4Rec 在批设定下就点击率或购买率等标准性能指标而言,显著优于行为策略及强 RL 与非 RL 基线。BCD4Rec 的其他有用特性包括:i. 从正确潜在类别推荐物品,表明尽管动作空间巨大(量级为物品数),仍具有更优的价值估计;ii. 克服离线日志中点击或购买物品典型的流行度偏差。

关键词

引用

@article{arxiv.2012.08984,
  title  = {Batch-Constrained Distributional Reinforcement Learning for Session-based Recommendation},
  author = {Diksha Garg and Priyanka Gupta and Pankaj Malhotra and Lovekesh Vig and Gautam Shroff},
  journal= {arXiv preprint arXiv:2012.08984},
  year   = {2020}
}

备注

Presented at Offline Reinforcement Learning Workshop at Neural Information Processing Systems, 2020