中文

分布型 HJB 方程收敛逼近的易处理表示

机器学习 2025-03-10 v1 最优化与控制 机器学习

摘要

在强化学习 (RL) 中,决策策略的长期行为根据其平均回报进行评估。分布型 RL 已经出现,提出了学习回报分布的技术,这些技术为评估策略提供了额外的统计量,并纳入了风险敏感考量。当时间的流逝无法自然地划分为离散时间增量时,研究人员研究了连续时间 RL (CTRL) 问题,其中智能体状态和决策连续演化。在这种情况下,Hamilton-Jacobi-Bellman (HJB) 方程被公认为期望回报的特征,并且存在许多求解方法。然而,在连续时间设置下对分布型 RL 的研究仍处于起步阶段。最近的工作建立了分布型 HJB (DHJB) 方程,提供了 CTRL 中回报分布的第一个特征。这些方程及其解难以精确求解和表示,需要新的逼近技术。这项工作在此方向上迈出了步伐,确立了回报分布参数化方法的条件,在这些条件下 DHJB 方程可以被近似求解。特别是,我们证明了在分布型 RL 算法学习的统计量与相应分布之间映射的特定拓扑性质下,这些统计量的逼近会导致 DHJB 方程解的逼近。具体而言,我们证明了分布型 RL 中常见的分位数表示满足该拓扑性质,从而为连续时间分布型 RL 认证了一种高效的逼近算法。

关键词

引用

@article{arxiv.2503.05563,
  title  = {Tractable Representations for Convergent Approximation of Distributional HJB Equations},
  author = {Julie Alhosh and Harley Wiltzer and David Meger},
  journal= {arXiv preprint arXiv:2503.05563},
  year   = {2025}
}

备注

Accepted to RLDM 2025