互信息正则化的离线强化学习
机器学习
2024-02-29 v3 人工智能
摘要
离线 RL 的主要挑战在于查询分布外动作时出现的分布偏移,这使得策略改进方向被外推误差所偏置。大多数现有方法通过在策略改进或评估期间惩罚偏离行为策略的策略或价值来解决该问题。本工作中,我们提出一种新颖的 MISA 框架,从数据集中状态与动作之间互信息的角度,通过直接约束策略改进方向来处理离线 RL。MISA 构建了由策略与 Q 值参数化的互信息下界。我们表明,优化该下界等价于在离线数据集上最大化一步改进策略的似然。因此,我们将策略改进方向约束在数据流形内。所得算法同时通过添加互信息正则化来增强策略评估与改进。MISA 是一个通用框架,将保守 Q 学习(CQL)与行为正则化方法(如 TD3+BC)统一为特例。我们引入了 MISA 的 3 种不同变体,并经验性地证明更紧的互信息下界带来更好的离线 RL 性能。此外,我们广泛的实验表明,MISA 在 D4RL 基准的各项任务上显著优于大量基线,例如在 gym-locomotion 任务上取得 742.9 总分。我们的代码见于 https://github.com/sail-sg/MISA。
引用
@article{arxiv.2210.07484,
title = {Mutual Information Regularized Offline Reinforcement Learning},
author = {Xiao Ma and Bingyi Kang and Zhongwen Xu and Min Lin and Shuicheng Yan},
journal= {arXiv preprint arXiv:2210.07484},
year = {2024}
}
备注
NeurIPS 2023