面向动力学偏移数据的状态正则化策略优化
机器学习
2024-02-23 v4 人工智能
摘要
在许多真实场景中,强化学习(RL)算法在具有动力学偏移(即底层环境动力学不同)的数据上训练。当前多数方法通过训练上下文编码器来识别环境参数以应对该问题。具有动力学偏移的数据根据其环境参数被分开,以训练相应策略。然而,这些方法样本效率低下,因为数据被临时(ad hoc)使用,且为一个动力学训练的策略无法从所有其他不同动力学环境中收集的数据获益。本文中,我们发现许多具有相似结构但动力学不同的环境中,最优策略具有相似的平稳状态分布。我们利用该性质,从具有动力学偏移的数据中学习平稳状态分布,以实现高效的数据复用。该分布被用于正则化在新环境中训练的策略,从而引出 SRPO(状态正则化策略优化)算法。为进行理论分析,相似环境结构的直觉由同态 MDP 的概念刻画。我们随后给出了由平稳状态分布正则化的策略的性能下界保证。在实践中,SRPO 可作为基于上下文的算法在在线与离线 RL 设定中的附加模块。实验结果表明,SRPO 可显著提升若干基于上下文算法的数据效率并改善其整体性能。
引用
@article{arxiv.2306.03552,
title = {State Regularized Policy Optimization on Data with Dynamics Shift},
author = {Zhenghai Xue and Qingpeng Cai and Shuchang Liu and Dong Zheng and Peng Jiang and Kun Gai and Bo An},
journal= {arXiv preprint arXiv:2306.03552},
year = {2024}
}
备注
Accepted at NeurIPS 2023