中文

用于基于图像的目标位姿估计的3D增强对比知识蒸馏

计算机视觉与模式识别 2022-06-07 v1 人工智能

摘要

基于图像的目标位姿估计听起来令人惊叹,因为在真实应用中物体的形状往往不可用或不像照片那样容易获取。尽管这在一定程度上是一种优势,但3D视觉学习问题中未被利用的形状信息犹如“美玉之瑕”。在本文中,我们以一种合理的新设定处理该问题,即训练过程中利用3D形状,而测试仍纯粹基于图像。我们通过利用多模态方法学到的3D知识,提升了类别无关(category-agnostic)目标位姿估计的基于图像方法的性能。具体而言,我们提出了一种新颖的对比知识蒸馏框架,将多模态模型的3D增强图像表示有效迁移至基于图像的模型。我们将对比学习整合进知识蒸馏的两阶段训练流程中,为跨模态任务结合这两种方法提供了先进解决方案。我们在实验上以大幅优势(在 ObjectNet3D 数据集上提升高达 +5%)报告了优于现有类别无关基于图像方法的 SOTA 结果,证明了我们方法的有效性。

关键词

引用

@article{arxiv.2206.02531,
  title  = {3D-Augmented Contrastive Knowledge Distillation for Image-based Object Pose Estimation},
  author = {Zhidan Liu and Zhen Xing and Xiangdong Zhou and Yijiang Chen and Guichun Zhou},
  journal= {arXiv preprint arXiv:2206.02531},
  year   = {2022}
}

备注

Accepted for presentation at International Conference on Multimedia Retrieval (ICMR '22)