基于价值引导探索的生成式自动出价
机器学习
2025-04-28 v2 信息检索
摘要
自动出价凭借其强大的能力,在动态且竞争激烈的在线环境中优化出价决策,已成为广告平台的关键策略。现有方法通常采用基于规则的策略或强化学习(RL)技术。然而,基于规则的策略难以适应时间变化的市场条件,RL 方法在马尔可夫决策过程(MDP)框架下难以捕获关键的历史依赖性和观察。此外,这些方法常面临跨多样化广告目标确保策略适应性的挑战。随着离线训练方法日益普及以促进在线策略的部署和维护,基于固定离线数据集训练导致的行为模式记录和行为坍缩问题日益突出。为解决这些限制,本文引入一种新型离线生成式自动出价框架,称为价值引导探索(GAVE)。GAVE 通过基于得分的 Return-To-Go(RTG)模块适应各种广告目标。此外,GAVE集成了基于 RTG 的评估方法的行动探索机制,以确保稳定更新的同时探索新颖行动。还设计了可学习的价值函数,以引导行动探索方向并缓解离线分布外(OOD)问题。在两个离线数据集和真实场景部署上的实验结果表明,GAVE 在离线评估和在线 A/B 测试中均优于最先进的基准方法。通过应用本框架的核心方法,我们荣获了 NeurIPS 2024 competition 中的第一名——'AIGB Track: Learning Auto-Bidding Agents with Generative Models'。
引用
@article{arxiv.2504.14587,
title = {Generative Auto-Bidding with Value-Guided Explorations},
author = {Jingtong Gao and Yewen Li and Shuai Mao and Peng Jiang and Nan Jiang and Yejing Wang and Qingpeng Cai and Fei Pan and Peng Jiang and Kun Gai and Bo An and Xiangyu Zhao},
journal= {arXiv preprint arXiv:2504.14587},
year = {2025}
}