离线强化学习中,表达性模型真的必要吗?
机器学习
2024-12-17 v1 人工智能
摘要
在各种离线强化学习 (RL) 方法中,目标条件监督学习 (GCSL) 正日益受到关注,因为它将离线 RL 问题表述为序列建模任务,从而绕过了传统 RL 框架中价值学习 notoriously 困难的信用分配问题。然而,序列建模需要捕获轨迹数据中跨越长时间尺度的准确动力学,以确保合理的策略性能。为满足这一要求,近期文献中流行选择利用大型表达性模型,这虽然提高了计算和推理延迟。我们揭示了,尽管形式上矛盾且充满希望,轻量级模型(例如简单浅层 2 层 MLP)通过采用一种简单的递归规划方案,也能获得准确的动力学一致性和显著降低的序列建模误差:该方案基于当前信息和目标信息递归规划粗粒度未来子目标,然后执行由数据中标注了这些子目标真实值的目标条件策略学习得到的动作。我们称该方法为递归跳过规划 (RSP)。简单而有效,RSP 由于其轻量级结构,实现了显著的效率提升,并在 D4RL 框架上超越了现有方法,尤其在多阶段长期程任务中达到了新的 SOTA 水平。
引用
@article{arxiv.2412.11253,
title = {Are Expressive Models Truly Necessary for Offline RL?},
author = {Guan Wang and Haoyi Niu and Jianxiong Li and Li Jiang and Jianming Hu and Xianyuan Zhan},
journal= {arXiv preprint arXiv:2412.11253},
year = {2024}
}
备注
Instead of relying on expressive models, shallow MLPs can also excel in long sequential decision-making tasks with Recursive Skip-Step Planning (RSP)