Pic@Point:基于局部和全局点-图对应关系的跨模态学习
计算机视觉与模式识别
2024-10-15 v1 人工智能
摘要
自监督预训练在NLP和2D视觉领域取得了显著的成功,但这些进展尚未转化为3D数据的应用。诸如掩码重建等技术在非结构化点云上面临固有的挑战,而许多对比学习任务又缺乏复杂度和信息价值。本文提出了Pic@Point,这是一种基于结构2D-3D对应关系的有效对比学习方法。我们利用图像中丰富的语义和上下文信息,为点云表示在不同抽象层级上提供引导信号。我们的轻量级方法在多个3D基准测试上超越了最新的预训练方法。
引用
@article{arxiv.2410.09519,
title = {Pic@Point: Cross-Modal Learning by Local and Global Point-Picture Correspondence},
author = {Vencia Herzog and Stefan Suwelack},
journal= {arXiv preprint arXiv:2410.09519},
year = {2024}
}
备注
Accepted at ACML 2024