中文

基于内容排序优化的合作多智能体深度强化学习

机器学习 2024-08-09 v1

摘要

在典型的电子商务场景中,内容排序优化(CRO)机制用于在搜索页面中展示内容,以满足客户的购物任务。CRO 通常利用诸如情境深度赝胚模型之类的模型,独立地在不同位置对内容进行排序,例如,一个专用于有机搜索结果,另一个专用于赞助式结果。然而,这种区域化优化方法未必等同于整页优化,例如,最大化页面顶部的收入可能不恰当地削弱了较低位置的收入。本文提出了一种基于强化学习的方法,用于整页排序,以跨所有位置联合优化:1)将位置级优化转变为整页级优化,以实现整体优化排序;2)应用强化学习优化累积奖励而非即时奖励。我们将整页 CRO 建模为合作多智能体马尔可夫决策过程(MADP),并通过 novel Multi-Agent Deep Deterministic Policy Gradient(MADDPG)模型加以实现。MADDPG 采用“集中训练、分布执行”方法,支持灵活可扩展的联合优化框架。大量实验表明,MADDPG 能够在拥有 25.7% 性能提升的公开 MuJoCo 环境中扩展至 25.7% 的行动空间,并在来自某头部电商公司的离线 CRO 数据集上超越深度赝胚建模。我们预见,这种新型多智能体优化方法可应用于信息检索领域类似的联合优化问题。

关键词

引用

@article{arxiv.2408.04251,
  title  = {Cooperative Multi-Agent Deep Reinforcement Learning in Content Ranking Optimization},
  author = {Zhou Qin and Kai Yuan and Pratik Lahiri and Wenyang Liu},
  journal= {arXiv preprint arXiv:2408.04251},
  year   = {2024}
}

备注

14 pages