基于动态解耦球形径向压制的约束增强强化学习
机器学习
2026-05-07 v1 机器人学
摘要
在将强化学习策略部署到物理机器人时,执行器速率约束——即每个控制步骤中每个关节运动速度的硬限制——是不可避免的。这些限制因电机惯性、功率带宽和传动刚度的差异而在关节之间呈现显著异质性,现有方法未能从几何上加以处理:每个关节的可行区域在动作增量空间中形成高维箱,而 QP 投影和球面参数化方法则施加各向同性球形约束,随着异质性增大而指数级地低估真实可行集。本文提出动态解耦球形径向压制 (DD-SRad),通过为每个执行器独立计算位置自适应半径,实现对真实关节可行区域的紧密对齐。DD-SRad 以概率~1 满足每一步硬约束,保持训练期间良好的条件梯度,并支持零运行时求解器开销的精确策略梯度反向传播。MuJoCo 基准实验显示,DD-SRad 在零约束违反的情况下获得最高任务回报——匹配无约束上限——并在约束空间覆盖方面比球面基线提高 30%--50%。高保真 IsaacLab 模拟中的 Unitree H1 和 G1 人形机器人实验确认,能够直接从官方关节规格参数化出端到端的最优解,验证了从硬件数据手册到安全部署的系统性路径。
引用
@article{arxiv.2605.04185,
title = {Constraint-Enhanced Reinforcement Learning Based on Dynamic Decoupled Spherical Radial Squashing},
author = {Qijun Liao and Zhaoxin Yu and Jue Yang},
journal= {arXiv preprint arXiv:2605.04185},
year = {2026}
}
备注
27 pages, 60 figures