乐观主义见足:风险敏感的离线强化学习
机器学习
2024-07-11 v1 最优化与控制
统计理论
机器学习
统计理论
摘要
我们研究了风险敏感强化学习(RL),这是一项关键领域,能够增强在管理不确定性并最小化潜在不利结果的场景中的决策能力。特别地,我们的工作聚焦于将熵元风险度量应用于 RL 问题。虽然现有文献主要研究在线设置,但仍存大量空白,即如何仅使用预收集数据就高效地推导出基于此风险度量的近最优策略。我们聚焦于线性马尔可夫决策过程(MDP)设置,这一被广泛认可的理论框架尚未从风险敏感角度进行研究。作为回应,我们引入了两个可证明样本高效的算法。我们首先提出一种风险敏感乐观价值迭代算法,凭借对风险敏感性能度量结构的利用,提供了紧密分析。为进一步改善获得的界限,我们提出另一种利用方差信息和参考优势分解的乐观算法,有效改善了空间维度 和风险敏感因子的依赖。据我们所知,我们获得了首个可证明高效的风险敏感离线 RL 算法。
引用
@article{arxiv.2407.07631,
title = {Pessimism Meets Risk: Risk-Sensitive Offline Reinforcement Learning},
author = {Dake Zhang and Boxiang Lyu and Shuang Qiu and Mladen Kolar and Tong Zhang},
journal= {arXiv preprint arXiv:2407.07631},
year = {2024}
}
备注
ICML 2024