基于跨视角感知学习细粒度对应关系的开放词汇 6D 物体位姿估计
计算机视觉与模式识别
2026-01-21 v1 机器人学
图像与视频处理
摘要
开放词汇 6D 物体位姿估计使机器人能够仅凭自然语言引导操作任意未见物体。然而,现有方法的一个关键局限在于其依赖无约束的全局匹配策略。在开放世界场景中,尝试将锚点特征与整个查询图像空间进行匹配会引入过度歧义,因为目标特征极易与背景干扰物混淆。为解决此问题,我们提出了细粒度对应位姿估计(FiCoP),这是一个从易受噪声影响的全局匹配过渡到空间约束的块级对应关系的框架。我们的核心创新在于利用块到块相关矩阵作为结构先验来缩小匹配范围,有效滤除无关杂波以防止其降低位姿估计性能。首先,我们引入以物体为中心的解耦预处理,将语义目标从环境噪声中隔离出来。其次,提出了跨视角全局感知(CPGP)模块以融合双视角特征,通过显式上下文推理建立结构共识。最后,我们设计了块相关预测器(PCP),生成精确的块级关联图,作为空间滤波器以实施细粒度且抗噪的匹配。在 REAL275 与 Toyota-Light 数据集上的实验表明,FiCoP 相较于最先进方法将平均召回率分别提升了 8.0% 和 6.1%,凸显了其在复杂、无约束的开放世界环境中为机器人智能体提供稳健且具泛化性的感知能力。源代码将公开于 https://github.com/zjjqinyu/FiCoP。
引用
@article{arxiv.2601.13565,
title = {Learning Fine-Grained Correspondence with Cross-Perspective Perception for Open-Vocabulary 6D Object Pose Estimation},
author = {Yu Qin and Shimeng Fan and Fan Yang and Zixuan Xue and Zijie Mai and Wenrui Chen and Kailun Yang and Zhiyong Li},
journal= {arXiv preprint arXiv:2601.13565},
year = {2026}
}
备注
The source code will be made publicly available at https://github.com/zjjqinyu/FiCoP