中文

理解与改进双曲深度强化学习

机器学习 2026-03-09 v2 人工智能

摘要

双曲几何的指数体积增长能够以远低于欧几里得空间的失真嵌入强化学习(RL)中状态之间的层级关系。然而,双曲深度 RL 面临着严重的优化挑战,且缺乏对优化为何失败的正式分析。我们确定了决定双曲深度 RL 智能体训练成败的关键因素。通过分析双曲几何的 Poincaré Ball 和 Hyperboloid 模型中核心操作的梯度,我们证明了大范数嵌入会破坏基于梯度的训练的稳定性,导致近端策略优化(PPO)中的信赖域违规。基于这些见解,我们引入了 Hyper++,一种由三个组件组成的新型双曲深度 RL 智能体:(1) 特征正则化,在避免截断引发维度灾难的同时保证范数有界;(2) 用于稳定评论家训练的分类价值损失;(3) 一种对优化更友好的双曲网络层表述。在 ProcGen 上,我们表明 Hyper++ 保证了稳定的学习,优于先前的双曲智能体,并将实际运行时间减少了约 30%。在带有 Double DQN 的 Atari-5 上,Hyper++ 大幅优于欧几里得和双曲基线。我们在 https://github.com/Probabilistic-and-Interactive-ML/hyper-rl 发布了我们的代码。

关键词

引用

@article{arxiv.2512.14202,
  title  = {Understanding and Improving Hyperbolic Deep Reinforcement Learning},
  author = {Timo Klein and Thomas Lang and Andrii Shkabrii and Alexander Sturm and Kevin Sidak and Lukas Miklautz and Claudia Plant and Yllka Velaj and Sebastian Tschiatschek},
  journal= {arXiv preprint arXiv:2512.14202},
  year   = {2026}
}

备注

ICLR 2026 Camera-ready