中文

BraVE:面向离散组合动作空间的离线强化学习

机器学习 2026-01-09 v3

摘要

在高维、离散动作空间中进行离线强化学习具有挑战性,因为联合动作空间随子动作数量呈指数级增长,且子动作依赖关系建模复杂。现有方法要么穷举评估动作空间,导致计算上不可行,要么分解 Q 值,无法表示联合子动作效应。我们提出了分支值估计(BraVE),这是一种基于值的方法,它使用树状结构的动作遍历来评估线性数量的联合动作,同时保留依赖结构。在拥有超过四百万个动作的环境中,BraVE 的性能比先前的离线 RL 方法高出多达 20×20\times

关键词

引用

@article{arxiv.2410.21151,
  title  = {BraVE: Offline Reinforcement Learning for Discrete Combinatorial Action Spaces},
  author = {Matthew Landers and Taylor W. Killian and Hugo Barnes and Thomas Hartvigsen and Afsaneh Doryab},
  journal= {arXiv preprint arXiv:2410.21151},
  year   = {2026}
}