离线强化学习的一个易处理推断视角
机器学习
2025-02-07 v3 人工智能
摘要
离线强化学习(RL)任务的一个流行范式是先将离线轨迹拟合到一个序列模型中,然后提示模型给出能带来高期望回报的动作。除了获得准确的序列模型外,本文强调易处理性——即精确且高效地回答各类概率查询的能力——在离线 RL 中起着重要作用。具体而言,由于来自离线数据收集策略与环境动力学的根本随机性,要引出有回报的动作需要高度非平凡的条件/约束生成。尽管仍可能近似此类查询,我们观察到这种粗略估计会严重削弱具表达力的序列模型所带来的益处。为克服该问题,本文提出 Trifle(Tractable Inference for Offline RL,离线 RL 的易处理推断),它利用现代易处理概率模型(TPMs)来弥合良好序列模型与评估时高期望回报之间的差距。在实验上,Trifle 在 9 个 Gym-MuJoCo 基准中以最先进的分数超越强基线。此外,得益于其易处理性,Trifle 在随机环境与安全 RL 任务(例如带动作约束的)中以最小的算法修改显著优于先前方法。
引用
@article{arxiv.2311.00094,
title = {A Tractable Inference Perspective of Offline RL},
author = {Xuejie Liu and Anji Liu and Guy Van den Broeck and Yitao Liang},
journal= {arXiv preprint arXiv:2311.00094},
year = {2025}
}