中文

具有通用函数逼近的可证明风险敏感分布强化学习

机器学习 2024-02-29 v1

摘要

在强化学习 (RL) 领域,考虑风险对于在不确定性下做出决策至关重要,特别是在安全性和可靠性至关重要的应用中。本文引入了一个关于风险敏感分布强化学习 (RS-DisRL) 的通用框架,该框架包含静态 Lipschitz 风险度量 (LRM) 和通用函数逼近。我们的框架涵盖了一大类风险敏感 RL,有助于分析估计函数对 RSRL 策略有效性的影响,并评估其样本复杂度。我们设计了两种创新的元算法:\texttt{RS-DisRL-M},一种针对基于模型的函数逼近的基于模型的策略;以及 \texttt{RS-DisRL-V},一种针对通用价值函数逼近的无模型方法。通过在增强马尔可夫决策过程 (MDP) 的分布 RL 中利用最小二乘回归 (LSR) 和最大似然估计 (MLE) 的新颖估计技术,我们推导出了具有静态 LRM 的 RSRL 的遗憾上界的首个 O~(K)\widetilde{\mathcal{O}}(\sqrt{K}) 依赖关系,标志着在该领域统计高效算法方面的开创性贡献。

关键词

引用

@article{arxiv.2402.18159,
  title  = {Provable Risk-Sensitive Distributional Reinforcement Learning with General Function Approximation},
  author = {Yu Chen and Xiangcheng Zhang and Siwei Wang and Longbo Huang},
  journal= {arXiv preprint arXiv:2402.18159},
  year   = {2024}
}