中文

基于 Pareto 前沿的约束感知生成式自竞价

机器学习 2026-02-10 v1 计算机科学与博弈论

摘要

自动竞价系统旨在满足诸如目标成本/行为(CPA)等严格效率约束的同时最大化营销价值。虽然决策转换器提供了强大的序列建模能力,但将其应用于受约束设置面临两个挑战:1)标准的 Return-to-Go 条件导致状态别名,忽略成本维度,无法实现精确的资源分配;2)标准回归迫使策略模仿平均历史行为,从而限制了其接近约束边界以优化性能的能力。为此,我们提出 PRO-Bid,一个基于两种协同机制的约束感知生成式自竞价框架:1)约束解耦的 Pareto 表示(CDPR)将全局约束分解为递归成本和价值上下文,以恢复资源感知,同时基于 Pareto 前沿对轨迹进行重新加权以聚焦高效数据;2)反事实后悔优化(CRO)通过利用全局结果预测器识别更优的反事实动作来实现主动改进。将这些高效结果作为加权回归目标,模型超越历史平均数,接近最优约束边界。大量实验在两个公共基准和在线 A/B 测试中表明,PRO-Bid 在满足约束和获取价值方面优于最先进的基线方法。

关键词

引用

@article{arxiv.2602.08261,
  title  = {Constraint-Aware Generative Auto-bidding via Pareto-Prioritized Regret Optimization},
  author = {Binglin Wu and Yingyi Zhang and Xianneng Li and Ruyue Deng and Chuan Yue and Weiru Zhang and Xiaoyi Zeng},
  journal= {arXiv preprint arXiv:2602.08261},
  year   = {2026}
}