中文

SHIC:无关键点监督的形状-图像对应

计算机视觉与模式识别 2024-07-29 v1

摘要

标准化表面映射通过为对象的每个像素分配一个对应的 3D 模板点来概括关键点检测的工作。DensePose 用于人类分析后,作者们尝试将概念应用于更多类别,但由于高昂的手动监督成本,取得的成功有限。本文中,我们引入 SHIC,这是一种无需手动监督即可学习标准化映射的方法,可实现优于监督方法的大多数类别的结果。我们的想法是利用诸如 DINO 和 Stable Diffusion 等基础计算机视觉模型,这些模型是开放式的,因而在自然类别方面拥有极佳的先验知识。SHIC 将估计图像到模板对应关系的问题简化为使用基础模型特征预测图像到图像对应关系的任务。该简化方法通过将对象图像与模板的非写实渲染视图匹配来实现,这模拟了为此任务收集手动注释的过程。随后,这些对应关系用于监督任何感兴趣对象的高质量标准化映射。我们还展示了图像生成器可以进一步提高模板视图的真实感,这为模型提供了额外的监督来源。

关键词

引用

@article{arxiv.2407.18907,
  title  = {SHIC: Shape-Image Correspondences with no Keypoint Supervision},
  author = {Aleksandar Shtedritski and Christian Rupprecht and Andrea Vedaldi},
  journal= {arXiv preprint arXiv:2407.18907},
  year   = {2024}
}

备注

ECCV 2024. Project website https://www.robots.ox.ac.uk/~vgg/research/shic/