EBaReT:用于自动竞价的专家引导袋奖励 Transformer
机器学习
2025-07-23 v1 信息检索
摘要
强化学习已广泛应用于自动竞价。传统方法将竞价建模为马尔可夫决策过程(MDP)。近期,一些研究探索了使用生成式强化学习方法来解决竞价环境中的长期依赖问题。尽管有效,但这些方法通常依赖监督学习方法,由于次优出价数量多以及由低点击率和转化率导致的低概率奖励,这些方法容易受到低数据质量的影响。遗憾的是,很少有研究解决这些挑战。在本文中,我们将自动竞价形式化为一个序列决策问题,并提出了一种新颖的专家引导袋奖励 Transformer(EBaReT),以解决与数据质量和不确定性奖励相关的问题。具体而言,为了解决数据质量问题,我们生成了一组专家轨迹作为训练过程中的补充数据,并采用基于正未标记(PU)学习的判别器来识别专家转移。为了确保决策也达到专家水平,我们进一步设计了一种新颖的专家引导推理策略。此外,为了缓解奖励的不确定性,我们将一定时期内的转移视为一个“袋”,并精心设计了一个奖励函数,以实现更平滑的奖励获取。大量实验表明,与最先进的竞价方法相比,我们的模型取得了更优的性能。
引用
@article{arxiv.2507.16186,
title = {EBaReT: Expert-guided Bag Reward Transformer for Auto Bidding},
author = {Kaiyuan Li and Pengyu Wang and Yunshan Peng and Pengjia Yuan and Yanxiang Zeng and Rui Xiang and Yanhua Cheng and Xialong Liu and Peng Jiang},
journal= {arXiv preprint arXiv:2507.16186},
year = {2025}
}