中文

基于离策略强化学习的序列搜索

信息检索 2022-02-02 v1 机器学习

摘要

近年来,序列推荐(SR)受到了大量关注,其旨在理解和建模用户随时间的行为序列以及用户与物品之间的交互。令人惊讶的是,尽管序列推荐取得了巨大成功,作为其孪生学习任务的序列搜索(SS)却鲜有研究;序列搜索除历史查询会话上的行为外,还考虑了用户当前与过去的搜索查询。对于大多数电商公司而言,由于其大得多的在线服务需求与流量规模,SS 学习任务甚至比对应的 SR 任务更为重要。为此,我们提出一种高度可扩展的混合学习模型,由利用短期用户-物品交互中所有特征的 RNN 学习框架,以及利用长期交互中选定仅含物品特征的注意力模型组成。作为一种新颖的优化步骤,我们通过在训练批次内即时求解贪心背包问题,在单次 RNN 传递中拟合多条短用户序列。此外,我们探索了离策略(off-policy)强化学习在多会话个性化搜索排序中的使用。具体而言,我们设计了一种成对深度确定性策略梯度(Deep Deterministic Policy Gradient)模型,有效捕获用户就成对分类误差而言的长期奖励。大量消融实验表明,在多种离线与在线指标上,各组件均相对于其最先进(state-of-the-art)基线带来了显著提升。

关键词

引用

@article{arxiv.2202.00245,
  title  = {Sequential Search with Off-Policy Reinforcement Learning},
  author = {Dadong Miao and Yanan Wang and Guoyu Tang and Lin Liu and Sulong Xu and Bo Long and Yun Xiao and Lingfei Wu and Yunjiang Jiang},
  journal= {arXiv preprint arXiv:2202.00245},
  year   = {2022}
}

备注

10 pages, 7 figures, CIKM 2021