中文

超越分布:连续强化学习的几何动作控制范式

人工智能 2026-01-30 v3

摘要

高斯策略在连续控制领域主导地位,却存在根本性矛盾:其无界支持需依赖人工 squashing 函数,扭曲有界动作空间的几何结构。虽然 von Mises-Fisher (vMF) 分布在球面上提供理论依据,但其依赖 Bessel 函数和拒绝抽样,限制了实际应用。我们提出几何动作控制 (GAC) 框架,既保留球形分布的几何优势,又简化计算过程。GAC 将动作生成分解为方向向量与可学习浓度参数,实现确定性动作与均匀球面噪声之间的高效插值。该设计将参数数量从 2d2d 降至 d+1d+1,避免 vMF 拒绝抽样的 O(dk)O(dk) 复杂度,实现简单 O(d)O(d) 操作。实验表明,GAC 在六个 MuJoCo 基准测试中稳健地匹配或超越当前最先进方法,在 Ant-v4 上比 SAC 提升 37.6\%,在复杂 DMControl 任务中提升最高达 112\%。我们的消融研究表明,"球面归一化"与"可适应浓度控制"是 GAC 成功的关键因素。这些发现表明,稳健且高效的连续控制无需复杂分布,而是需对动作空间的几何结构保持恰当尊重。

关键词

引用

@article{arxiv.2511.08234,
  title  = {Beyond Distributions: Geometric Action Control for Continuous Reinforcement Learning},
  author = {Zhihao Lin},
  journal= {arXiv preprint arXiv:2511.08234},
  year   = {2026}
}

备注

22 pages, 8 figures