中文

结合离线奖励评估与策略搜索增强生成式自动竞价

机器学习 2026-03-04 v4 人工智能

摘要

自动竞价是广告主提升广告效果的关键工具。近期进展表明,从离线数据中学习条件生成规划器的 AI 生成竞价 (AIGB) 相比典型的基于离线强化学习 (RL) 的自动竞价方法取得了更优的性能。然而,现有 AIGB 方法由于本质上无法探索具有反馈的静态数据集之外的内容,仍面临性能瓶颈。为解决这一问题,我们提出 \textbf{AIGB-Pearl} (\emph{\textbf{P}lanning with \textbf{E}valu\textbf{A}tor via \textbf{RL}}),这是一种结合生成式规划与策略优化的新方法。AIGB-Pearl 的核心在于构建一个轨迹评估器以评估生成分数的质量,并设计一种可证明可靠的 KL-Lipschitz 约束分数最大化方案,以确保在离线数据集之外进行安全高效的探索。进一步开发了一种结合同步耦合技术的实用算法,以保证该方案所需的模型正则性。在模拟和真实广告系统上的大量实验表明,我们的方法达到了 SOTA 性能。

关键词

引用

@article{arxiv.2509.15927,
  title  = {Enhancing Generative Auto-bidding with Offline Reward Evaluation and Policy Search},
  author = {Zhiyu Mou and Yiqin Lv and Miao Xu and Qi Wang and Yixiu Mao and Jinghao Chen and Qichen Ye and Chao Li and Rongquan Bai and Chuan Yu and Jian Xu and Bo Zheng},
  journal= {arXiv preprint arXiv:2509.15927},
  year   = {2026}
}