中文

级联强化学习

机器学习 2024-04-09 v4

摘要

级联老虎机近年来因其在推荐系统和在线广告中的适用性而受到欢迎。在级联老虎机模型中,每个时间步,代理从一组物品中推荐一个有序的物品子集(称为物品列表),每个物品关联一个未知的吸引力概率。然后,用户检查该列表,并点击第一个有吸引力的物品(如果有),此后代理获得奖励。代理的目标是最大化期望累积奖励。然而,先前关于级联老虎机的文献忽略了用户状态(例如,历史行为)对推荐的影响以及会话进行中状态的变化。受此事实启发,我们提出了一个广义的级联强化学习框架,该框架考虑了用户状态和状态转移对决策的影响。在级联强化学习中,我们不仅需要选择吸引力概率大的物品,还需要选择能导向良好后继状态的物品。由于组合动作空间,这带来了巨大的计算挑战。为应对这一挑战,我们深入研究了价值函数的性质,并设计了一个预言机 BestPerm 来高效地找到最优物品列表。借助 BestPerm,我们开发了两种算法 CascadingVI 和 CascadingBPI,它们计算高效且样本高效,并提供了接近最优的遗憾界和样本复杂度保证。此外,我们通过实验展示了我们的算法在实践中相比现有强化学习算法直接改编版本在计算和样本效率上的提升。

关键词

引用

@article{arxiv.2401.08961,
  title  = {Cascading Reinforcement Learning},
  author = {Yihan Du and R. Srikant and Wei Chen},
  journal= {arXiv preprint arXiv:2401.08961},
  year   = {2024}
}