BraVE:面向离散组合动作空间的离线强化学习
机器学习
2026-01-09 v3
摘要
在高维、离散动作空间中进行离线强化学习具有挑战性,因为联合动作空间随子动作数量呈指数级增长,且子动作依赖关系建模复杂。现有方法要么穷举评估动作空间,导致计算上不可行,要么分解 Q 值,无法表示联合子动作效应。我们提出了分支值估计(BraVE),这是一种基于值的方法,它使用树状结构的动作遍历来评估线性数量的联合动作,同时保留依赖结构。在拥有超过四百万个动作的环境中,BraVE 的性能比先前的离线 RL 方法高出多达 。
引用
@article{arxiv.2410.21151,
title = {BraVE: Offline Reinforcement Learning for Discrete Combinatorial Action Spaces},
author = {Matthew Landers and Taylor W. Killian and Hugo Barnes and Thomas Hartvigsen and Afsaneh Doryab},
journal= {arXiv preprint arXiv:2410.21151},
year = {2026}
}