中文

优化多模态模型用于基于图像的形状检索:预对齐与困难对比学习的作用

计算机视觉与模式识别 2026-03-10 v1 信息检索

摘要

基于图像的形状检索旨在根据查询图像从数据库中检索三维模型,因此涉及计算机视觉、计算机图形学和机器人学中的一项经典任务。近期方法通常依赖于基于多视图渲染以及特定任务的度量学习来弥合二维图像与三维形状之间的领域差距,从而将形状和图像嵌入到共同的潜在空间中。相比之下,我们通过大规模多模态预训练来处理基于图像的形状检索,并表明显式的基于视图的监督并非必要。受ULIP和OpenShape中用于三维形状分类等任务的预对齐图像-点云编码器的启发,我们提出使用预对齐的图像和形状编码器进行零样本和标准基于图像的形状检索,方法是将图像和点云嵌入到共享表示空间中,并通过在紧凑的单嵌入形状描述符上进行相似性搜索来执行检索。这种公式化方法允许跳过视图合成,并自然地实现零样本和跨领域检索,而无需在目标数据库上重新训练。我们在零样本和监督式基于图像的形状检索设置中评估了预对齐编码器,并额外引入了一种多模态困难对比损失以进一步提高检索性能。我们的评估展示了最先进的性能,在多个数据集上的形状检索中,在AccTop1Acc_{Top1}AccTop10Acc_{Top10}指标上优于相关方法,其中OpenShape与Point-BERT结合取得了最佳结果。此外,在我们提出的多模态困难对比损失上进行训练,在以形状为中心的数据的标准实例检索任务中带来了依赖于数据集的增益,这凸显了预训练和困难对比学习对于三维形状检索的价值。代码将通过项目网站提供。

关键词

引用

@article{arxiv.2603.06982,
  title  = {Optimizing Multi-Modal Models for Image-Based Shape Retrieval: The Role of Pre-Alignment and Hard Contrastive Learning},
  author = {Paul Julius Kühn and Cedric Spengler and Michael Weinmann and Arjan Kuijper and Saptarshi Neil Sinha},
  journal= {arXiv preprint arXiv:2603.06982},
  year   = {2026}
}