基于排列等变模型的离线强化学习自动出价
机器学习
2025-06-24 v1 人工智能
摘要
强化学习 (RL) 用于自动出价的趋势从使用简单离线模拟器 (Simulation-based RL Bidding, SRLB) 转向基于固定真实数据集的离线 RL (Offline RL Bidding, ORLB)。然而,ORLB 策略受限于数据集的 state space coverage,仅提供有限的收益。虽然 SRLB 扩大了 state coverage,但 simulator-reality gap 风险会误导策略。本文提出 Model-based RL Bidding (MRLB),从真实数据中学习环境模型以弥合这一差距。MRLB 使用真实数据和 model 生成的数据训练策略,超越 ORLB 扩展 state coverage。为确保 model 可靠性,我们提出:1) 一种 permutation 等变 model architecture 以获得更好的 generalization,以及 2) 一种对 model 错误持悲观态度的 robust offline Q-learning 方法。这些构成了 Permutation Equivariant Model-based Offline RL (PE-MORL) 算法。真实世界实验表明,PE-MORL 超越了最先进的自动出价方法。
引用
@article{arxiv.2506.17919,
title = {Permutation Equivariant Model-based Offline Reinforcement Learning for Auto-bidding},
author = {Zhiyu Mou and Miao Xu and Wei Chen and Rongquan Bai and Chuan Yu and Jian Xu},
journal= {arXiv preprint arXiv:2506.17919},
year = {2025}
}