面向离线强化学习的保守状态价值估计
机器学习
2023-12-05 v2 人工智能
摘要
离线强化学习面临由于数据集与当前所学策略之间的分布漂移导致的价值高估这一重大挑战,从而在实践学习中导致失败。常见方法是在 Bellman 迭代中对奖励或价值估计引入惩罚项。同时,为避免对分布外(OOD)状态和动作的外推,现有方法聚焦于保守 Q 函数估计。本文提出保守状态价值估计(CSVE),一种通过对 OOD 状态直接施加惩罚来学习保守 V 函数的新方法。相较先前工作,CSVE 能实现更有效的状态价值估计并具备保守性保证,进而获得更好的策略优化。进一步,我们应用 CSVE 开发了一种实用的 actor-critic 算法,其中评论者通过对数据集\emph{周围}的状态进行额外采样与惩罚来完成保守价值估计,而行动者应用扩展有状态探索的优势加权更新来改进策略。我们在 D4RL 的经典连续控制任务上评估,表明我们的方法优于保守 Q 函数学习方法,并且在近期 SOTA 方法中具有强劲竞争力。
引用
@article{arxiv.2302.06884,
title = {Conservative State Value Estimation for Offline Reinforcement Learning},
author = {Liting Chen and Jie Yan and Zhengdao Shao and Lu Wang and Qingwei Lin and Saravan Rajmohan and Thomas Moscibroda and Dongmei Zhang},
journal= {arXiv preprint arXiv:2302.06884},
year = {2023}
}
备注
Accepted in NeurIPS 2023