中文

UniTac2Pose:一种在仿真中学习的类别级视触觉手持位姿估计统一方法

机器学习 2025-09-22 v1

摘要

基于 CAD 模型准确估计物体的手持位姿在工业应用和日常任务中至关重要,从定位工件和组装组件到无缝插入 USB 连接器等设备。虽然现有方法通常依赖回归、特征匹配或配准技术,但实现高精度和对未见 CAD 模型的泛化能力仍然是一个重大挑战。在本文中,我们提出了一种用于手持位姿估计的新型三阶段框架。第一阶段涉及对位姿候选进行采样和预排序,随后在第二阶段对这些候选进行迭代细化。在最后阶段,应用后排序以识别最可能的位姿候选。这些阶段由一个统一的基于能量的扩散模型控制,该模型仅在仿真数据上训练。该能量模型同时生成梯度以细化位姿估计,并产生一个量化位姿估计质量的能量标量。此外,借鉴计算机视觉领域的思想,我们在基于能量的分数网络中引入了渲染-比较架构,以显著增强从仿真到现实的性能,正如我们的消融研究所证明的那样。我们进行了全面的实验,表明我们的方法优于基于回归、匹配和配准技术的传统基线,同时对先前未见的 CAD 模型表现出强大的类内泛化能力。此外,我们的方法将触觉物体位姿估计、位姿跟踪和不确定性估计集成到一个统一的框架中,在各种现实世界条件下实现了稳健的性能。

关键词

引用

@article{arxiv.2509.15934,
  title  = {UniTac2Pose: A Unified Approach Learned in Simulation for Category-level Visuotactile In-hand Pose Estimation},
  author = {Mingdong Wu and Long Yang and Jin Liu and Weiyao Huang and Lehong Wu and Zelin Chen and Daolin Ma and Hao Dong},
  journal= {arXiv preprint arXiv:2509.15934},
  year   = {2025}
}