标准策略:学习用于SE(3)-等变策略的标准三维表示
机器人学
2025-11-11 v2
摘要
视觉模仿学习在机器人操作中取得了显著进展,但泛化到未见物体、场景布局和相机视角仍然是一个关键挑战。近期进展通过使用三维点云(提供几何感知、外观不变的表示)以及在策略架构中融入等变性来利用空间对称性来解决这一问题。然而,现有的等变方法由于等变成分的非结构化整合,往往缺乏可解释性和严谨性。我们提出标准策略(canonical policy),一个用于三维等变模仿学习的基础框架,将三维点云观测统一在标准表示之下。我们首先建立了三维标准表示的理论,通过将已见和新颖的点云分组到标准表示中,实现等变的观测到动作映射。然后我们提出一个灵活的策略学习流水线,利用标准表示中的几何对称性和现代生成模型的表达能力。我们在12个不同的模拟任务和4个真实世界操作任务上验证了标准策略,涵盖16种配置,涉及物体颜色、形状、相机视角和机器人平台的差异。与现有最先进的模仿学习策略相比,标准策略在模拟中平均提升18.0%,在真实世界实验中提升39.7%,展现出更优的泛化能力和样本效率。更多细节请访问项目网站:https://zhangzhiyuanzhang.github.io/cp-website/。
引用
@article{arxiv.2505.18474,
title = {Canonical Policy: Learning Canonical 3D Representation for SE(3)-Equivariant Policy},
author = {Zhiyuan Zhang and Zhengtong Xu and Jai Nanda Lakamsani and Yu She},
journal= {arXiv preprint arXiv:2505.18474},
year = {2025}
}