中文

DINO 吃掉 CLIP:面向开放集 3D 物体检索的超越已知类自适应

计算机视觉与模式识别 2026-04-22 v1

摘要

视觉基础模型通过对多视图图像的高效适应,在开放集 3D 物体检索(3DOR)中展现出巨大潜力。利用语义对齐的潜在空间,先前的工作通常适应 CLIP 编码器以构建基于视图的 3D 描述符。尽管 CLIP 具有很强的泛化能力,但其缺乏细粒度性促使我们探索更新的自监督编码器 DINO 的潜力。为了解决这一问题,我们提出了 DINO Eats CLIP(DEC),这是一个用于动态多视图整合的新框架,通过为未见类合成数据进行正则化。我们首先发现,简单地从冻结的 DINO 主干网络中对视图特征进行平均池化就能给出不错的性能。然而,进一步的适应会导致对已知类的平均视图模式产生严重的过拟合。为了克服这一问题,我们设计了一个名为分块与适应模块(CAM)的模块。它将多视图图像分割成块并动态整合局部视图关系,从而产生比标准池化策略更鲁棒的特征。最后,我们提出了虚拟特征合成(VFS)模块,以显式缓解对已知类别的偏差。在底层,VFS 利用 CLIP 宽泛的、预对齐的视觉-语言空间来为未见类合成虚拟特征。通过让 DEC 暴露于这些虚拟特征,我们极大地增强了其开放集判别能力。在标准开放集 3DOR 基准上的大量实验证明了其卓越的有效性。

关键词

引用

@article{arxiv.2604.19432,
  title  = {DINO Eats CLIP: Adapting Beyond Knowns for Open-set 3D Object Retrieval},
  author = {Xinwei He and Yansong Zheng and Qianru Han and Zhichuan Wang and Yuxuan Cai and Yang Zhou and Jingbo Xia and Yulong Wang and Jinhai Xiang and Xiang Bai},
  journal= {arXiv preprint arXiv:2604.19432},
  year   = {2026}
}

备注

Accepted to CVPR 2026