理解并解决离线强化学习中基于互模拟表示的缺陷
机器学习
2023-10-27 v1
摘要
尽管基于互模拟的方法有望为强化学习(RL)任务学习鲁棒的状态表示,但其在离线 RL 任务中的效果却不尽如人意。在某些情况下,其性能甚至显著逊于替代方法。我们旨在理解为何互模拟方法在在线设定中成功,却在离线任务中受挫。我们的分析表明,数据集中缺失的转移对互模拟原则尤为有害,导致估计失效。我们还阐明了奖励缩放在约束互模拟度量尺度及其引发的价值误差方面的关键作用。基于这些发现,我们提出将期望分位数(expectile)算子应用于我们的离线 RL 设定中的表示学习,有助于防止对不完整数据的过拟合。同时,通过引入恰当的奖励缩放策略,我们避免了表示空间中的特征坍缩风险。我们在两种最先进的基于互模拟的算法 MICo 和 SimSR 上实现了这些建议,并在 D4RL 和 Visual D4RL 两个基准套件上展示了性能提升。代码见 \url{https://github.com/zanghyu/Offline_Bisimulation}。
引用
@article{arxiv.2310.17139,
title = {Understanding and Addressing the Pitfalls of Bisimulation-based Representations in Offline Reinforcement Learning},
author = {Hongyu Zang and Xin Li and Leiji Zhang and Yang Liu and Baigui Sun and Riashat Islam and Remi Tachet des Combes and Romain Laroche},
journal= {arXiv preprint arXiv:2310.17139},
year = {2023}
}
备注
NeurIPS 2023