公式监督的视觉-几何预训练
计算机视觉与模式识别
2024-09-23 v1
摘要
在计算机视觉史上,尽管研究探索了图像(视觉)和点云(几何)的集成,但许多在图像和 3D 目标识别方面的突破性进展往往是分别处理这些模态的。我们旨在通过集成图像和点云于统一的转换模型来弥合这一鸿沟。该方法集成了图像和点云的模态特定特性,并通过学习视觉-几何表征,在统一的转换模型上实现图像和 3D 目标识别的基本下游任务。本文引入了公式监督的视觉-几何预训练(FSVGP),这是一种新型合成预训练方法,能够自动从数学公式生成对齐的合成图像和点云。通过跨模态监督,我们实现了视觉和几何模态之间的监督式预训练。FSVGP 还减少了对真实数据收集、跨模态对齐和人工标注的依赖。我们的实验结果表明,FSVGP 在六项任务上(图像和 3D 目标分类、检测和分割)的预训练效果优于 VisualAtom 和 PC-FractalDB。这些成就表明 FSVGP 在图像和 3D 目标识别中的泛化能力更佳,凸显了合成预训练在视觉-几何表征学习中的潜力。我们的项目网站可在 https://ryosuke-yamada.github.io/fdsl-fsvgp/ 查看。
引用
@article{arxiv.2409.13535,
title = {Formula-Supervised Visual-Geometric Pre-training},
author = {Ryosuke Yamada and Kensho Hara and Hirokatsu Kataoka and Koshi Makihara and Nakamasa Inoue and Rio Yokota and Yutaka Satoh},
journal= {arXiv preprint arXiv:2409.13535},
year = {2024}
}
备注
Accepted to ECCV2024