中文

高分辨率开放词汇对象6D姿态估计

计算机视觉与模式识别 2024-07-12 v2

摘要

在6D姿态估计任务中,对未见对象的泛化非常具有挑战性。虽然视觉语言模型(VLM)可利用自然语言描述支持未见对象的6D姿态估计,但这些解决方案的性能仍低于基于模型的方法。本文提出了Horyon,一个基于开放词汇VLM的架构,用于仅通过文本提示对未见对象的两个场景之间的相对姿态估计。我们利用文本提示识别未见对象,然后获取高分辨率的多尺度特征。这些特征用于提取跨场景匹配以进行注册。在我们的方法在由四个数据集构成的基准测试上进行评估,包括REAL275、Toyota-Light、Linemod和YCB-Video。我们的方法在所有数据集上实现了最先进的性能,相较于前最佳方法在平均召回率上提升了12.6。

关键词

引用

@article{arxiv.2406.16384,
  title  = {High-resolution open-vocabulary object 6D pose estimation},
  author = {Jaime Corsetti and Davide Boscaini and Francesco Giuliari and Changjae Oh and Andrea Cavallaro and Fabio Poiesi},
  journal= {arXiv preprint arXiv:2406.16384},
  year   = {2024}
}

备注

Technical report. Extension of CVPR paper "Open-vocabulary object 6D pose estimation". Project page: https://jcorsetti.github.io/oryon