中文

基于多智能体强化学习的多情景组合以优化广告推荐系统

机器学习 2024-07-04 v1 人工智能

摘要

本文探讨了在大型平台上使用多智能体强化学习(MARL)进行多情景优化。我们通过将诸如搜索、推荐和广告等情景视为合作的、部分可观测的多智能体决策问题来实现这一点。我们引入了多智能体循环确定性策略梯度(MARDPG)算法,该算法在共享目标下对齐不同情景,并允许策略通信以提升整体性能。我们的结果在CTR、转化率和总销售额等指标上均实现了显著提升,确认了该方法在实际应用中的有效性。

关键词

引用

@article{arxiv.2407.02759,
  title  = {Multi-Scenario Combination Based on Multi-Agent Reinforcement Learning to Optimize the Advertising Recommendation System},
  author = {Yang Zhao and Chang Zhou and Jin Cao and Yi Zhao and Shaobo Liu and Chiyu Cheng and Xingchen Li},
  journal= {arXiv preprint arXiv:2407.02759},
  year   = {2024}
}

备注

Accepted by 2024 5th International Conference on Artificial Intelligence and Electromechanical Automation IEEE (ISBN: 979-8-3503-6617-4)