中文

非线性强化学习的几何学

机器学习 2025-09-03 v1

摘要

奖励最大化、安全探索和内在动机在强化学习(RL)中常被作为独立的目标来研究。我们提出了一个统一的几何框架,将这些目标视为环境中可实现的长期行为空间上的单一优化问题的实例。在此框架内,策略镜像下降、自然策略梯度和信赖域算法等经典方法自然地推广到非线性效用和凸约束。我们阐述了这一视角如何涵盖鲁棒性、安全性、探索和多样性目标,并概述了几何学与深度强化学习交叉领域面临的开放挑战。

关键词

引用

@article{arxiv.2509.01432,
  title  = {The Geometry of Nonlinear Reinforcement Learning},
  author = {Nikola Milosevic and Nico Scherf},
  journal= {arXiv preprint arXiv:2509.01432},
  year   = {2025}
}