HeRO:用于姿态感知对象操控的层次化 3D 语义表示
计算机视觉与模式识别
2026-02-24 v1
摘要
机器人操控的模仿学习已从 2D 图像策略发展到显式编码几何的 3D 表示。然而,纯粹的几何策略往往缺乏显式的部件级语义,这对于姿态感知操控至关重要(例如,区分鞋子的前端与后端)。本文提出 HeRO,一种基于扩散模型的策略,通过层次化语义场将几何与语义耦合。HeRO 采用稠密语义提升,将来自 DINOv2 的判别性、几何敏感特征与来自 Stable Diffusion 的光滑、全球一致的对应关系融合,产生既细粒度又在空间上一致的稠密特征。这些特征被处理和分区以构建全局场和若干局部场。层次化条件模块使用不变于排列的网络架构对生成去噪器进行条件化,从而避免顺序敏感偏差,为姿态感知操控生成连贯的控制策略。在各种测试中,HeRO 建立了新的状态突破,Place Dual Shoes 成功率提升 12.3%,在六项具有挑战性的姿态感知任务中平均提升 6.5%。代码已公开 https://github.com/Chongyang-99/HeRO。
引用
@article{arxiv.2602.18817,
title = {HeRO: Hierarchical 3D Semantic Representation for Pose-aware Object Manipulation},
author = {Chongyang Xu and Shen Cheng and Haipeng Li and Haoqiang Fan and Ziliang Feng and Shuaicheng Liu},
journal= {arXiv preprint arXiv:2602.18817},
year = {2026}
}
备注
Accepted by ICRA 2026