RoboEye: 通过选择性3D几何关键点匹配增强2D机器人目标识别
计算机视觉与模式识别
2025-09-19 v1 人工智能
机器人学
摘要
大规模电子商务中产品类别的快速增长使得仓库自动化打包中的准确目标识别变得更加困难。随着目录的增长,类内变异性和大量罕见或视觉相似的项目增多,再加上多样化的包装、杂乱的容器、频繁的遮挡和大幅度的视角变化——这些因素加剧了查询图像与参考图像之间的差异,导致仅依赖2D外观特征的方法性能急剧下降。因此,我们提出了RoboEye,一个两阶段识别框架,通过领域自适应的3D推理和轻量级适配器动态增强2D语义特征,以弥合训练与部署之间的差距。在第一阶段,我们训练一个大视觉模型来提取2D特征以生成候选排序。一个轻量级的3D特征感知模块随后估计3D特征质量并预测是否需要3D重排序,从而防止性能退化并避免不必要的计算。当被调用时,第二阶段使用我们的机器人3D检索变换器,该变换器由一个产生几何感知密集特征的3D特征提取器和一个计算查询图像与参考图像之间关键点对应置信度的基于关键点的匹配器组成,而非传统的余弦相似度评分。实验表明,RoboEye相比先前最先进方法(RoboLLM)将Recall@1提高了7.1%。此外,RoboEye仅使用RGB图像运行,避免了对显式3D输入的依赖并降低了部署成本。本文使用的代码公开可用,地址为:https://github.com/longkukuhi/RoboEye。
引用
@article{arxiv.2509.14966,
title = {RoboEye: Enhancing 2D Robotic Object Identification with Selective 3D Geometric Keypoint Matching},
author = {Xingwu Zhang and Guanxuan Li and Zhuocheng Zhang and Zijun Long},
journal= {arXiv preprint arXiv:2509.14966},
year = {2025}
}