中文

基于最优传输理论的风险感知强化学习

机器学习 2023-09-13 v1 系统与控制 系统与控制

摘要

在强化学习(RL)所运行的动态且不确定的环境中,风险管理成为保障可靠决策的关键因素。传统 RL 方法虽在奖励优化上有效,却常忽视潜在风险的全貌。为此,本文开创性地将最优传输(OT)理论与 RL 结合,创建一种风险感知框架。我们的方法修正了目标函数,确保所得策略不仅最大化期望奖励,还遵从由状态访问分布与期望风险轮廓之间的 OT 距离所决定的风险约束。通过利用 OT 的数学精确性,我们给出了一种将风险考量与传统 RL 目标并列提升的公式。我们的贡献由一系列定理所夯实,刻画了风险分布、最优值函数与策略行为之间的关系。借由 OT 的视角,本工作阐明了 RL 的一个有前景的方向,确保奖励追求与风险感知的平衡融合。

关键词

引用

@article{arxiv.2309.06239,
  title  = {Risk-Aware Reinforcement Learning through Optimal Transport Theory},
  author = {Ali Baheri},
  journal= {arXiv preprint arXiv:2309.06239},
  year   = {2023}
}