SLowRL:面向 locomotion 的安全低秩适配强化学习
机器人学
2026-03-19 v1
摘要
仿真到现实的 locomotion 策略迁移常常导致性能下降,由于不可避免的仿真-现实差距。直接在硬件上进行策略微调往往会引发机械故障并存在样本效率低下的问题。本文旨在安全且高效地微调 dynamic locomotion 任务的强化学习(RL)策略。具体而言,我们聚焦于直接在硬件上微调在仿真中学习到的策略,并显式地施加安全约束。为此,我们引入 SLowRL 框架,将低秩适配(LoRA)与通过恢复策略实现训练时安全性 enforcement 相结合。我们在仿真环境和实际 Unitree Go2 四足机器人上对 jump 和 trot 任务进行评估。实验结果表明,我们的方法在细调时间上减少了 ,且几乎没有安全违规,显著优于标准的近端策略优化(PPO)基线。值得注意的是,仅用秩-1 的适配即可在实际环境中恢复预训练性能,同时保持稳定和安全的现实细调。这些结果表明了在 dynamic 实际应用场景中进行安全、高效细调的可行性。
关键词
引用
@article{arxiv.2603.17092,
title = {SLowRL: Safe Low-Rank Adaptation Reinforcement Learning for Locomotion},
author = {Elham Daneshmand and Shafeef Omar and Glen Berseth and Majid Khadiv and Hsiu-Chin Lin},
journal= {arXiv preprint arXiv:2603.17092},
year = {2026}
}