CAWR:面向鲁棒策略优化的抗损坏优势加权回归
机器学习
2025-06-19 v1
摘要
离线强化学习(offline RL)算法通常需要额外的约束或惩罚项来解决分布迁移问题,例如在策略优化过程中添加隐式或显式的策略约束以减少函数估计偏差。本文聚焦于优势加权回归(AWRs)族方法的一个局限性,即由于数据损坏可能导致学习过于保守的策略,具体表现为对次优离线数据中的探索不足。我们从两个角度进行研究:(1)如何表述的探索不足影响基于KL散度的最优策略;(2)这种探索不足如何影响对最优策略的近似。我们证明,这种过度保守主要由策略优化损失函数对探索不足的敏感性以及离线数据集中探索不足比例所致。为此,我们提出抗损坏优势加权回归(CAWR),在策略优化中融入一组鲁棒损失函数,并采用基于优势的优先级经验回放方法以筛选出探索不足的数据。在D4RL基准上的数值实验表明,我们的方法能够从次优离线数据中学习出优异策略,显著提升策略优化的性能。
引用
@article{arxiv.2506.15654,
title = {CAWR: Corruption-Averse Advantage-Weighted Regression for Robust Policy Optimization},
author = {Ranting Hu},
journal= {arXiv preprint arXiv:2506.15654},
year = {2025}
}
备注
23 pages, 14 figures