中文

描述、适配与组合:赋能CLIP编码器用于开放集三维物体检索

计算机视觉与模式识别 2025-07-30 v1

摘要

开放集三维物体检索(3DOR)是一项新兴任务,旨在检索训练集之外未见类别的三维物体。现有方法通常利用所有模态(即体素、点云、多视图图像),并在融合前训练特定的骨干网络。然而,由于三维训练数据不足,它们仍然难以生成泛化的表示。CLIP通过在网络规模的图像-文本对上对比预训练,天然地为广泛的 downstream 任务生成了泛化表示。基于此,我们提出了一个简单而有效的框架,命名为描述、适配与组合(DAC),仅利用多视图图像进行开放集3DOR。DAC创新性地将CLIP模型与多模态大语言模型(MLLM)协同起来,以学习泛化的三维表示,其中MLLM用于双重目的。首先,它在训练期间描述已知类别信息,以与CLIP的训练目标对齐,从而进行适配。其次,它在推理期间提供关于未知物体的外部提示,作为视觉线索的补充。为了提高协同作用,我们引入了一种加性偏差低秩适配(AB-LoRA),它减轻了过拟合,并进一步增强了向未见类别的泛化能力。仅使用多视图图像,DAC在四个开放集3DOR数据集上平均比先前技术高出+10.01%的mAP。此外,其泛化能力也在基于图像和跨数据集的设置中得到了验证。代码可在 https://github.com/wangzhichuan123/DAC 获取。

关键词

引用

@article{arxiv.2507.21489,
  title  = {Describe, Adapt and Combine: Empowering CLIP Encoders for Open-set 3D Object Retrieval},
  author = {Zhichuan Wang and Yang Zhou and Zhe Liu and Rui Yu and Song Bai and Yulong Wang and Xinwei He and Xiang Bai},
  journal= {arXiv preprint arXiv:2507.21489},
  year   = {2025}
}

备注

Accepted to ICCV 2025