多模态多任务预训练提升点云理解
计算机视觉与模式识别
2025-07-24 v1
摘要
最近在多模态预训练方法方面的进展通过对齐3D形状与其对应2D图像之间的多模态特征,在学习3D表示方面显示出有希望的有效性。然而,现有的多模态预训练框架主要依赖单一预训练任务来收集3D应用中的多模态数据。这种局限性阻碍了模型获取其他相关任务提供的丰富信息,这可能会损害其在下游任务中的性能,尤其是在复杂和多样化的领域。为了解决这个问题,我们提出了MMPT,一个旨在增强点云理解的多模态多任务预训练框架。具体来说,设计了三个预训练任务:(i) 令牌级重建旨在恢复被掩码的点令牌,赋予模型表征学习能力。(ii) 点级重建被集成用于直接预测被掩码的点位置,重建的点云可被视为后续任务中使用的变换点云。(iii) 多模态对比学习结合了模态内和跨模态的特征对应关系,从而以自监督方式从3D点云和2D图像模态中汇集了丰富的学习信号。此外,该框架无需任何3D标注即可运行,使其可扩展到大型数据集。训练好的编码器可以有效地迁移到各种下游任务。为了证明其有效性,我们在广泛使用的基准测试中,针对各种判别和生成应用,将其性能与最先进的方法进行了比较评估。
引用
@article{arxiv.2507.17533,
title = {Multi-modal Multi-task Pre-training for Improved Point Cloud Understanding},
author = {Liwen Liu and Weidong Yang and Lipeng Ma and Ben Fei},
journal= {arXiv preprint arXiv:2507.17533},
year = {2025}
}