中文

C2: 具有约束感知损失的交叉学习模块增强决策Transformer用于自动出价

机器学习 2026-01-30 v2 计算机科学与博弈论

摘要

决策Transformer(Decision Transformer, DT)通过捕获时间依赖性在生成式自动出价中显示出潜力,但存在两个关键限制:状态、动作和待实现回报(RTG)序列之间的交叉相关性建模不足,以及对最优/次优行为的无差别学习。为了解决这些问题,我们提出了C2,一个新颖的框架,通过两个核心创新增强了DT:(1)一个通过交叉注意力实现的交叉学习块(Cross Learning Block, CLB),以加强序列间相关性建模;(2)一个约束感知损失(Constraint-aware Loss, CL),结合预算和单次获客成本(CPA)约束,用于选择性学习最优轨迹。在AuctionNet数据集上的广泛离线评估表明,在不同的预算设置下,性能持续提升(比最先进方法高达3.2%);消融研究验证了CLB和CL的互补协同作用,证实了C2在自动出价中的优越性。复现我们结果的代码可在以下网址获取:https://github.com/Dingjinren/C2。

关键词

引用

@article{arxiv.2601.20257,
  title  = {C2:Cross learning module enhanced decision transformer with Constraint-aware loss for auto-bidding},
  author = {Jinren Ding and Xuejian Xu and Shen Jiang and Zhitong Hao and Jinhui Yang and Peng Jiang},
  journal= {arXiv preprint arXiv:2601.20257},
  year   = {2026}
}