中文

关于深度强化学习中SO(3)作用表征的入门指南

机器人学 2026-02-24 v2 人工智能

摘要

许多机器人控制任务需要策略对姿态进行操作,但SO(3的几何性质使得这一任务不为人知。由于SO(3不存在全局光滑且最小的参数化,常见的表示方法如欧拉角、四元数、旋转矩阵和Lie代数坐标都会引入不同的约束和失效模式。虽然这些权衡在监督学习中已广为人知,但在强化学习中的应用仍不明确。我们在三个标准连续控制算法(PPO、SAC、TD3)下,对SO(3)作用表征进行系统评估,分别在稠密奖励和稀疏奖励环境下进行测试。我们比较了不同表征如何影响探索,如何与熵正则化交互,以及通过经验研究分析不同投影获取有效旋转的意义。在一套机器人基准测试中,我们量化了这些选择的实际影响,并提炼出针对旋转动作选择和使用的简单、可直接实现的指南。我们的结果表明,表征引起的几何强烈影响探索和优化,并显示将动作表示为局部坐标系中切向量在各算法中最为可靠。项目网页和代码均可在 amacati.github.io/so3-primer 访问。

关键词

引用

@article{arxiv.2510.11103,
  title  = {A Primer on SO(3) Action Representations in Deep Reinforcement Learning},
  author = {Martin Schuck and Sherif Samy and Angela P. Schoellig},
  journal= {arXiv preprint arXiv:2510.11103},
  year   = {2026}
}