基于逆优化的离线层次化强化学习
机器学习
2025-03-19 v2 系统与控制
系统与控制
最优化与控制
摘要
层次化策略在许多序列决策问题中能够实现卓越的性能,包括高维动作空间、需要长期规划和奖励稀疏的情境。然而,从静态离线数据中学习层次化策略 presents a significant challenge。关键的是,较高层次策略所采取的动作可能在层次化控制器中不可直接观察,且离线数据集可能是使用不同策略结构生成的,阻碍了标准离线学习算法的使用。在本工作中,我们提出了OHIO:一个用于离线强化学习(RL)的层次化策略框架。我们的框架利用策略结构的知识来解决\textit{逆问题},恢复可能在我们的层次化策略下生成所观察数据的不可观察的高层次动作。这一方法构建了一个适用于标准离线训练的数据集。我们在机器人和网络优化问题上展示了我们的框架,并表明它超越端到端RL方法,提高了鲁棒性。我们探讨了该框架的各种实例,包括直接部署离线训练的策略以及进行在线微调的情况。代码和数据均可在 https://ohio-offline-hierarchical-rl.github.io 获得。
引用
@article{arxiv.2410.07933,
title = {Offline Hierarchical Reinforcement Learning via Inverse Optimization},
author = {Carolin Schmidt and Daniele Gammelli and James Harrison and Marco Pavone and Filipe Rodrigues},
journal= {arXiv preprint arXiv:2410.07933},
year = {2025}
}