面向多辅助任务广告分配的强化学习列表级表示学习
机器学习
2022-08-12 v3
摘要
随着近期强化学习(RL)的流行,利用 RL 在推荐平台(如电商与新闻流网站)中进行广告分配引起了巨大关注。为实现更优分配,近期基于 RL 的广告分配方法的输入已从点级单项升级为列表级项排列。然而,这也导致了状态-动作对的高维空间,使得难以学习具备良好泛化能力的列表级表示。这进一步阻碍了 RL 智能体的探索并导致样本效率低下。为解决该问题,我们提出了一种新颖的基于 RL 的广告分配方法,通过利用美团外卖平台上面向任务的特定信号来学习更好的列表级表示。具体而言,我们根据广告分配的先验领域知识,分别基于重构、预测与对比学习提出了三种不同的辅助任务。我们在美团外卖平台上进行了大量实验以评估所提辅助任务的有效性。离线与在线实验结果均表明,相较于 SOTA 基线,所提方法能学习更好的列表级表示并为平台带来更高收益。
引用
@article{arxiv.2204.00888,
title = {Learning List-wise Representation in Reinforcement Learning for Ads Allocation with Multiple Auxiliary Tasks},
author = {Ze Wang and Guogang Liao and Xiaowen Shi and Xiaoxu Wu and Chuheng Zhang and Yongkang Wang and Xingxing Wang and Dong Wang},
journal= {arXiv preprint arXiv:2204.00888},
year = {2022}
}
备注
Accepted by CIKM-22