中文

MDDL:一种基于强化学习的多通道信息流位置分配框架

信息检索 2023-04-19 v1 人工智能 机器学习

摘要

如今,位置分配系统的主流方法是利用强化学习模型为各通道中的项目分配合适位置,再将其混合进信息流。用于训练位置分配强化学习(RL)模型的数据有两类,称为策略数据与随机数据。策略数据收集自当前线上模型,其状态-动作对分布不均衡,导致训练期间严重的过高估计问题。另一方面,随机数据的状态-动作对分布更均匀,但在工业场景中难以获取,因为随机探索可能对平台收益与用户体验造成负面影响。由于两类数据分布不同,设计有效策略以利用两者提升 RL 模型训练效果成为极具挑战的问题。本研究提出名为多分布数据学习(MDDL)的框架,以解决在混合多分布数据上有效利用策略与随机数据训练 RL 模型的挑战。具体而言,MDDL 引入一种新颖的模仿学习信号以缓解策略数据的过高估计问题,并最大化随机数据的 RL 信号以促进有效学习。在我们的实验中,我们在真实世界位置分配系统评估了所提 MDDL 框架,并证明其相较先前基线具有更优性能。MDDL 已全量部署于美团外卖平台,目前服务超 3 亿用户。

关键词

引用

@article{arxiv.2304.09087,
  title  = {MDDL: A Framework for Reinforcement Learning-based Position Allocation in Multi-Channel Feed},
  author = {Xiaowen Shi and Ze Wang and Yuanying Cai and Xiaoxu Wu and Fan Yang and Guogang Liao and Yongkang Wang and Xingxing Wang and Dong Wang},
  journal= {arXiv preprint arXiv:2304.09087},
  year   = {2023}
}

备注

4 pages, 2 figures, accepted by SIGIR 2023