高分辨率开放词汇对象6D姿态估计
计算机视觉与模式识别
2024-07-12 v2
摘要
在6D姿态估计任务中,对未见对象的泛化非常具有挑战性。虽然视觉语言模型(VLM)可利用自然语言描述支持未见对象的6D姿态估计,但这些解决方案的性能仍低于基于模型的方法。本文提出了Horyon,一个基于开放词汇VLM的架构,用于仅通过文本提示对未见对象的两个场景之间的相对姿态估计。我们利用文本提示识别未见对象,然后获取高分辨率的多尺度特征。这些特征用于提取跨场景匹配以进行注册。在我们的方法在由四个数据集构成的基准测试上进行评估,包括REAL275、Toyota-Light、Linemod和YCB-Video。我们的方法在所有数据集上实现了最先进的性能,相较于前最佳方法在平均召回率上提升了12.6。
引用
@article{arxiv.2406.16384,
title = {High-resolution open-vocabulary object 6D pose estimation},
author = {Jaime Corsetti and Davide Boscaini and Francesco Giuliari and Changjae Oh and Andrea Cavallaro and Fabio Poiesi},
journal= {arXiv preprint arXiv:2406.16384},
year = {2024}
}
备注
Technical report. Extension of CVPR paper "Open-vocabulary object 6D pose estimation". Project page: https://jcorsetti.github.io/oryon