一视图,多世界:单图到三维物体与生成式域随机化在单次 6D 姿态估计中的结合
计算机视觉与模式识别
2025-09-10 v1
摘要
从单张参考图像估计任意未见物体的 6D 姿态对于在长尾分布中运行的机器人至关重要。然而,这一设置极具挑战性:三维模型很少可用,单视图重建缺乏度量尺度,且生成模型与真实图像之间的域差距会削弱鲁棒性。我们提出了 OnePoseViaGen,一个通过两个关键组件解决这些挑战的流程。首先,一个粗到细对齐模块通过结合多视图特征匹配与渲染-比较精修来联合优化尺度和姿态。其次,一种文本引导的生成式域随机化策略可以多样化纹理,从而使姿态估计器能够利用合成数据进行有效微调。这些步骤共同使高保真度的单视图三维生成能够支持可靠的单次 6D 姿态估计。在具有挑战性的基准测试(YCBInEOAT、Toyota-Light、LM-O)上,OnePoseViaGen 取得了远超先前方法的最新性能。我们进一步展示了使用真实机器人手进行稳健的灵巧抓取,验证了我们方法在实际操控中的实用性。项目页面:https://gzwsama.github.io/OnePoseviaGen.github.io/
引用
@article{arxiv.2509.07978,
title = {One View, Many Worlds: Single-Image to 3D Object Meets Generative Domain Randomization for One-Shot 6D Pose Estimation},
author = {Zheng Geng and Nan Wang and Shaocong Xu and Chongjie Ye and Bohan Li and Zhaoxi Chen and Sida Peng and Hao Zhao},
journal= {arXiv preprint arXiv:2509.07978},
year = {2025}
}
备注
CoRL 2025 Oral, Project page: https://gzwsama.github.io/OnePoseviaGen.github.io/