中文

基于排列等变模型的离线强化学习自动出价

机器学习 2025-06-24 v1 人工智能

摘要

强化学习 (RL) 用于自动出价的趋势从使用简单离线模拟器 (Simulation-based RL Bidding, SRLB) 转向基于固定真实数据集的离线 RL (Offline RL Bidding, ORLB)。然而,ORLB 策略受限于数据集的 state space coverage,仅提供有限的收益。虽然 SRLB 扩大了 state coverage,但 simulator-reality gap 风险会误导策略。本文提出 Model-based RL Bidding (MRLB),从真实数据中学习环境模型以弥合这一差距。MRLB 使用真实数据和 model 生成的数据训练策略,超越 ORLB 扩展 state coverage。为确保 model 可靠性,我们提出:1) 一种 permutation 等变 model architecture 以获得更好的 generalization,以及 2) 一种对 model 错误持悲观态度的 robust offline Q-learning 方法。这些构成了 Permutation Equivariant Model-based Offline RL (PE-MORL) 算法。真实世界实验表明,PE-MORL 超越了最先进的自动出价方法。

关键词

引用

@article{arxiv.2506.17919,
  title  = {Permutation Equivariant Model-based Offline Reinforcement Learning for Auto-bidding},
  author = {Zhiyu Mou and Miao Xu and Wei Chen and Rongquan Bai and Chuan Yu and Jian Xu},
  journal= {arXiv preprint arXiv:2506.17919},
  year   = {2025}
}