CrossJEPA:用于从2D图像高效3D表征学习的跨模态联合嵌入预测架构
计算机视觉与模式识别
2025-11-25 v1
摘要
图像到点跨模态学习已涌现出用于解决3D表征学习中大规模3D数据稀缺的问题。然而,当前利用2D数据的方法往往导致模型大、训练缓慢,在资源受限的环境中难以部署。因此,架构设计至关重要,决定其性能、内存占用和计算效率。联合嵌入预测架构(Joint-embedding Predictive Architecture, JEPA)因其简单性和效率在自监督学习中广受欢迎,但在跨模态设置中仍未得到充分探索,这部分原因可能源于 masking 被误认为是JEPA的固有属性。在此基础上,我们提出CrossJEPA,一种简单的Cross-modal Joint Embedding Predictive Architecture,利用图像基础模型的知识,并训练预测器推断特定渲染2D视图的嵌入,从而引入JEPA风格的预训练策略超越masking。通过对预测器进行跨域投影信息的条件化,CrossJEPA纯化了来自目标域唯一语义的监督信号。我们进一步利用冻结教师设计和一次性目标嵌入缓存机制,实现摊销效率。CrossJEPA在synthetic ModelNet40(94.2%)和real-world ScanObjectNN(88.3%)基准上的线性探针上实现了新的最先进成绩,仅使用14.1M预训练参数(点编码器为8.5M),约6小时即可在标准单GPU上完成训练。这些结果将CrossJEPA定位为一种高效、内存友好且快速训练的3D表征学习框架。我们对CrossJEPA进行直观、理论和实证分析,并广泛消化我们的设计选择。代码将公开提供。
引用
@article{arxiv.2511.18424,
title = {CrossJEPA: Cross-Modal Joint-Embedding Predictive Architecture for Efficient 3D Representation Learning from 2D Images},
author = {Avishka Perera and Kumal Hewagamage and Saeedha Nazar and Kavishka Abeywardana and Hasitha Gallella and Ranga Rodrigo and Mohamed Afham},
journal= {arXiv preprint arXiv:2511.18424},
year = {2025}
}
备注
24 pages, 10 figures