FILP-3D:利用预训练视觉 - 语言模型增强 3D 少样本类增量学习
计算机视觉与模式识别
2025-01-09 v2
摘要
少样本类增量学习 (FSCIL) 旨在缓解模型在有限数据上进行增量训练时的灾难性遗忘问题。然而,许多此类工作缺乏对先验知识的有效探索,导致它们无法有效解决 3D FSCIL 背景下的域差距问题,从而引发灾难性遗忘。对比视觉 - 语言预训练 (CLIP) 模型因其丰富的形状相关先验知识,成为解决 3D FSCIL 挑战的非常合适的主干网络。不幸的是,其直接应用于 3D FSCIL 仍面临 3D 数据表示与 2D 特征之间的不兼容性,主要表现为特征空间错位和显著噪声。为了解决上述挑战,我们引入了 FILP-3D 框架,包含两个新颖组件:用于解决特征空间错位的冗余特征消除器 (RFE) 和用于解决显著噪声的空间噪声补偿器 (SNC)。RFE 通过对预训练模型 (PTMs) 的特征空间执行独特的降维,对齐输入点云及其嵌入的特征空间,在不损害语义完整性的情况下有效消除冗余信息。另一方面,SNC 是一种基于图的 3D 模型,旨在捕获点云内的鲁棒几何信息,从而增强因投影而丢失的知识,特别是在处理真实世界扫描数据时。此外,传统的准确率指标被证明由于现有 3D 数据集的不平衡而存在偏差。因此,我们提出了 3D FSCIL 基准 FSCIL3D-XL 和新的评估指标,以提供对 3D FSCIL 模型更细致的评估。在既定基准和我们提出的基准上的实验结果表明,我们的方法显著优于现有的最先进方法。
引用
@article{arxiv.2312.17051,
title = {FILP-3D: Enhancing 3D Few-shot Class-incremental Learning with Pre-trained Vision-Language Models},
author = {Wan Xu and Tianyu Huang and Tianyu Qu and Guanglei Yang and Yiwen Guo and Wangmeng Zuo},
journal= {arXiv preprint arXiv:2312.17051},
year = {2025}
}