Q价值正则化生成式自动出价:从次优轨迹到最优策略
机器学习
2026-02-04 v2 人工智能
信息检索
摘要
随着电子商务的快速发展,自动出价已成为在多样化的广告主环境下优化广告绩效的关键资产。当前方法聚焦于强化学习(RL)和生成模型,这些方法通过利用复杂的结构和昂贵的超参数调优来模仿离线历史行为。次优轨迹进一步恶化了策略学习的难度。为解决这些挑战,我们提出了QGA(Q价值正则化生成式自动出价方法)。在QGA中,我们提出在决策转换器(Decision Transformer)框架中嵌入Q价值正则化与双Q学习策略。这种设计使策略拟合和动作价值最大化能够联合优化,使学习到的出价策略既能利用数据集中的经验,又能缓解次优轨迹的负面影响。此外,为在数据分布之外安全地探索策略空间,我们提出了Q价值引导的双探索机制,其中DT模型以多个回报目标和局部扰动动作为条件进行条件化。整个探索过程由前述Q价值模块动态引导,该模块为每个备选动作提供原则化的评估。在公共基准和仿真环境中的实验表明,QGA consistently achieves superior or highly competitive results compared to existing alternatives。值得注意的是,在大型实际A/B测试中,QGA实现了3.27%的广告总交易额(GMV)增加和2.49%的广告投资回报率(ROI)改善。
引用
@article{arxiv.2601.02754,
title = {Q-Regularized Generative Auto-Bidding: From Suboptimal Trajectories to Optimal Policies},
author = {Mingming Zhang and Na Li and Zhuang Feiqing and Hongyang Zheng and Jiangbing Zhou and Wang Wuyin and Sheng-jie Sun and XiaoWei Chen and Junxiong Zhu and Lixin Zou and Chenliang Li},
journal= {arXiv preprint arXiv:2601.02754},
year = {2026}
}
备注
Due to the company's compliance requirements, we would like to wait until the paper is officially published before making it publicly available on arXiv