中文

从数据集到真实世界:基于广义跨域少样本学习的通用 3D 物体检测

计算机视觉与模式识别 2026-01-09 v2

摘要

由于现有数据集中物体多样性有限,基于 LiDAR 的 3D 物体检测模型往往难以泛化到真实世界环境。为了解决这一问题,我们引入了 3D 物体检测中的首个广义跨域少样本(GCFS)任务,旨在仅用少样本标注,将源预训练模型适应到新领域中的常见类和新颖类。我们提出了一个统一框架,通过将 2D 开集语义与 3D 空间推理相结合,在有限监督下学习稳定的目标语义。具体而言,图像引导的多模态融合通过视觉语言模型将可迁移的 2D 语义线索注入 3D 流水线,而物理感知的边界框搜索则通过 LiDAR 先验增强 2D 到 3D 的对齐。为了从稀疏数据中捕获特定类别的语义,我们进一步引入了对比增强的原型学习,将少样本实例编码为具有判别力的语义锚点,并稳定表示学习。在 GCFS 基准上的大量实验证明了我们的方法在现实部署设置中的有效性和通用性。

关键词

引用

@article{arxiv.2503.06282,
  title  = {From Dataset to Real-world: General 3D Object Detection via Generalized Cross-domain Few-shot Learning},
  author = {Shuangzhi Li and Junlong Shen and Lei Ma and Xingyu Li},
  journal= {arXiv preprint arXiv:2503.06282},
  year   = {2026}
}

备注

The latest version refines the few-shot setting on common classes, enforcing a stricter object-level definition