面向广告自动出价的最优返回导向决策转换器
机器学习
2025-06-30 v1
摘要
在在线广告领域,广告主经常参与广告拍卖以获取广告位,频繁利用需求方平台提供的自动出价工具。为提高这些出价系统的自动化水平,我们采用决策转换器(Decision Transformer, DT)来解决自动出价中固有的难题。将决策转换器应用于自动出价任务,实现了统一的序列建模方法,有效克服了短视问题,捕捉过去出价动作与用户行为之间的长期依赖关系。然而,传统DT存在若干缺陷:(1)DT在生成动作前需要预设返回值(return-to-go, RTG),而该值本身并非天然生成;(2)DT学习的策略受限于训练数据,后者由混合质量的轨迹组成。为此,我们提出R*决策转换器(R* DT),通过三步过程实现:(1)R DT:类似传统DT,R DT根据状态和RTG值存储动作,并记忆给定状态的RTG值;(2)R^ DT:预测给定状态在训练集中的最高RTG值,基于当前状态和预测的最高RTG值推导亚最优策略;(3)R* DT:基于R^ DT生成轨迹,并选取高回报的轨迹(使用模拟器)来扩充训练数据集。此数据增强已被证明可提高训练数据中轨迹的RTG,逐步引导亚最优策略趋向最优。大规模测试表明,R* DT在处理混合质量轨迹方面具有卓越效能。
引用
@article{arxiv.2506.21956,
title = {Optimal Return-to-Go Guided Decision Transformer for Auto-Bidding in Advertisement},
author = {Hao Jiang and Yongxiang Tang and Yanxiang Zeng and Pengjia Yuan and Yanhua Cheng and Teng Sha and Xialong Liu and Peng Jiang},
journal= {arXiv preprint arXiv:2506.21956},
year = {2025}
}