中文

SlateFree:一种面向含板块动作强化学习的无模型分解方法

机器学习 2022-09-07 v1 人工智能 信息检索 网络与互联网体系结构 社会与信息网络

摘要

我们考虑序列推荐问题,其中每一步智能体从大小为K>>NK>>N的更大目录中向用户提出某板块(slate)的NN个不同物品。用户对推荐具有未知偏好,智能体借助强化学习采取优化(在我们的情形中最小化)某种用户相关成本的序列动作。一个板块可能的物品组合为(KN)\binom{K}{N},这一巨大数目使得值迭代方法难以处理。我们证明,slate-MDP实际上可使用每状态仅KK个物品相关的QQ函数进行分解,其以更紧凑高效的方式描述问题。基于此,我们提出一种新颖的无模型SARSA和Q-learning算法,其每步执行NN次并行迭代,且无需任何先验用户知识。我们称此方法为\texttt{SlateFree},即无板块(free-of-slates),并通过数值实验表明它对任意用户画像都能非常快速地收敛到精确最优,且优于文献中的替代方法。

关键词

引用

@article{arxiv.2209.01876,
  title  = {SlateFree: a Model-Free Decomposition for Reinforcement Learning with Slate Actions},
  author = {Anastasios Giovanidis},
  journal= {arXiv preprint arXiv:2209.01876},
  year   = {2022}
}

备注

12 pages, 9 sub-figures