面向自动竞价的轨迹级迭代强化学习框架
机器学习
2024-04-09 v2 人工智能
计算机科学与博弈论
信息检索
摘要
在线广告中,广告主参与广告拍卖以获取广告机会,通常利用需求方平台 (DSP) 提供的自动竞价工具。当前的自动竞价算法通常采用强化学习 (RL)。然而,出于安全考虑,大多数基于 RL 的自动竞价策略均在模拟环境中训练,导致部署到在线环境时性能下降。为缩小这一差距,我们可以并行部署多个自动竞价代理以收集大规模交互数据集,随后利用离线 RL 算法训练新策略。训练后的策略可再次部署以进行进一步的数据收集,从而形成一种迭代训练框架,我们称之为迭代离线 RL。在本文中,我们确定了该迭代离线 RL 框架的性能瓶颈,其源于离线 RL 算法固有的保守性所导致的低效探索与利用。为克服这一瓶颈,我们提出了轨迹级探索与利用 (TEE),该方法从轨迹视角为迭代离线 RL 引入了一种新颖的数据收集与数据利用方法。此外,为确保在线探索的安全性同时保持 TEE 的数据集质量,我们提出了自适应动作选择安全探索 (SEAS)。在阿里巴巴展示广告平台上的离线实验和真实世界实验均证明了我们所提方法的有效性。
引用
@article{arxiv.2402.15102,
title = {Trajectory-wise Iterative Reinforcement Learning Framework for Auto-bidding},
author = {Haoming Li and Yusen Huo and Shuai Dou and Zhenzhe Zheng and Zhilin Zhang and Chuan Yu and Jian Xu and Fan Wu},
journal= {arXiv preprint arXiv:2402.15102},
year = {2024}
}
备注
Accepted by The Web Conference 2024 (WWW'24) as an oral paper