利用结构化策略初始化改进并加速大型离散动作空间中的离线强化学习
机器学习
2026-01-29 v2
摘要
离散组合动作空间中的强化学习需要在指数级多的联合动作中进行搜索,以同时选择构成连贯组合的多个子动作。现有方法要么通过假设子动作之间相互独立来简化策略学习(这通常会导致不连贯或无效的动作),要么尝试联合学习动作结构与控制(这既缓慢又不稳定)。我们引入了结构化策略初始化(SPIN),这是一个两阶段框架:首先预训练动作结构模型(ASM)以捕获有效动作的流形,然后冻结该表示并训练轻量级策略头进行控制。在具有挑战性的离散 DM Control 基准上,SPIN 将平均回报率比现有技术提高了高达 39%,同时将收敛时间减少了高达 12.8 倍。
引用
@article{arxiv.2601.04441,
title = {Improving and Accelerating Offline RL in Large Discrete Action Spaces with Structured Policy Initialization},
author = {Matthew Landers and Taylor W. Killian and Thomas Hartvigsen and Afsaneh Doryab},
journal= {arXiv preprint arXiv:2601.04441},
year = {2026}
}