利用 Q 条件状态熵探索改进离线到在线强化学习
机器学习
2024-05-29 v4 人工智能
摘要
研究如何微调离线强化学习(RL)预训练策略对于提升 RL 算法的样本效率具有深远意义。然而,直接微调预训练策略往往导致次优性能。这主要是由于离线预训练与在线微调阶段之间的分布偏移。具体而言,分布偏移限制了有效在线样本的获取,最终影响了在线微调性能。为了缩小离线与在线阶段之间的分布偏移,我们提出将 Q 条件状态熵(QCSE)作为内在奖励。具体而言,QCSE 考虑各自 Q 值,对所有样本分别最大化其状态熵。该方法鼓励对低频样本的探索同时惩罚高频样本,并隐式地实现了状态边际匹配(SMM),从而确保最优性能,解决了基于约束方法的渐近次优性。此外,QCSE 可无缝集成到各种 RL 算法中,提升在线微调性能。为验证我们的主张,我们进行了大量实验,观察到使用 QCSE 带来的显著改进(对于 CQL 约 13%,对于 Cal-QL 约 8%)。此外,我们将实验测试扩展到其他算法,证实了 QCSE 的通用性。
引用
@article{arxiv.2310.19805,
title = {Improving Offline-to-Online Reinforcement Learning with Q Conditioned State Entropy Exploration},
author = {Ziqi Zhang and Xiao Xiong and Zifeng Zhuang and Jinxin Liu and Donglin Wang},
journal= {arXiv preprint arXiv:2310.19805},
year = {2024}
}