ReFORM:基于噪声操控的离线强化学习反射流
机器学习
2026-02-06 v1 人工智能
机器人学
摘要
离线强化学习 (RL) 旨在从固定数据集中学习最优策略,而无需额外的环境交互。在此设置下常见的挑战是发生于策略离开训练分布的情形。先前的方法通过对统计距离项进行惩罚来维持策略靠近行为策略,但这会限制策略的改进,且可能完全无法防止 OOD 动作。另一挑战在于最优策略分布可能是多模态且难以表示。最近的工作应用扩散或流策略以解决此问题,但尚不清楚如何在保持策略表达力的同时避免 OOD 错误。我们提出 ReFORM,这是一种基于流策略的离线 RL 方法,通过构造支持约束来实现较不严格的约束。ReFORM 通过学习一个具有有界源分布的行为克隆 (BC) 流策略来捕获动作分布的支持,然后优化反射流以生成有界噪声以保持支持,从而最大化性能。在 40 个来自 OGBench 数据集的具有挑战性的任务中,该方法在性能曲线下均优于所有基线方法,后者使用手工调优的超参数。
引用
@article{arxiv.2602.05051,
title = {ReFORM: Reflected Flows for On-support Offline RL via Noise Manipulation},
author = {Songyuan Zhang and Oswin So and H. M. Sabbir Ahmad and Eric Yang Yu and Matthew Cleaveland and Mitchell Black and Chuchu Fan},
journal= {arXiv preprint arXiv:2602.05051},
year = {2026}
}
备注
24 pages, 17 figures; Accepted by the fourteenth International Conference on Learning Representations (ICLR 2026)