基于通用视野模型的离线强化学习
机器学习
2026-05-18 v1 人工智能
摘要
基于模型的强化学习(RL)通过在想象的在线策略轨迹上进行价值学习,为离线 RL 提供了一种引人注目的方法。然而,由于在自生成状态上进行重复模型推理,它常常遭受复合误差的困扰。虽然几何视野模型(GHM)通过对折扣无限视野未来进行直接预测来缓解此问题,但它们在准确建模遥远未来状态方面仍面临挑战。为此,我们引入了通用视野模型(UHM),这是 GHM 的一种推广,它直接预测任意视野下的未来状态。利用这种灵活性,我们提出了一种可扩展的价值学习方法,该方法采用缩尾视野分布,通过截断过大的视野来稳定训练。在 100 个具有挑战性的 OGBench 任务上的实验结果表明,所提出的方法优于竞争基线,特别是在具有高度次优数据集和需要长视野推理的任务上。项目页面:https://rllab-snu.github.io/projects/UHM/
引用
@article{arxiv.2605.15603,
title = {Offline Reinforcement Learning with Universal Horizon Models},
author = {Hojun Chung and Junseo Lee and Songhwai Oh},
journal= {arXiv preprint arXiv:2605.15603},
year = {2026}
}
备注
ICML 2026