TeDA:通过测试时分布对齐提升视觉-语言模型在零样本三维物体检索中的性能
计算机视觉与模式识别
2025-05-06 v1
摘要
学习能够良好泛化到未知测试类别的判别性三维表征,是许多现实世界三维应用的新兴需求。由于缺乏来自更广泛概念的三维训练数据,现有的成熟方法通常难以实现这一目标。与此同时,预训练的大型视觉-语言模型(如CLIP)已展现出卓越的零样本泛化能力。然而,由于它们的二维训练分布与三维测试分布之间存在巨大差距,它们在提取合适的三维表征方面受到限制。为了解决这些挑战,我们提出了测试时分布对齐(TeDA),这是一个新颖的框架,可在测试时将预训练的二维视觉-语言模型CLIP适配于未知的三维物体检索。据我们所知,这是首个研究视觉-语言模型在三维特征学习中的测试时适配的工作。TeDA将三维物体投影为多视图图像,使用CLIP提取特征,并通过一种基于置信查询-目标样本对的迭代优化策略,以自我提升的方式细化三维查询嵌入。此外,TeDA整合了由多模态语言模型(InternVL)生成的文本描述,以增强对三维物体的理解,利用CLIP对齐的特征空间融合视觉和文本线索。在四个开放集三维物体检索基准上的大量实验表明,TeDA显著优于最先进的方法,甚至包括那些需要大量训练的方法。我们还在Objaverse-LVIS上对深度图进行了实验,进一步验证了其有效性。代码可在https://github.com/wangzhichuan123/TeDA获取。
引用
@article{arxiv.2505.02325,
title = {TeDA: Boosting Vision-Lanuage Models for Zero-Shot 3D Object Retrieval via Testing-time Distribution Alignment},
author = {Zhichuan Wang and Yang Zhou and Jinhai Xiang and Yulong Wang and Xinwei He},
journal= {arXiv preprint arXiv:2505.02325},
year = {2025}
}
备注
Accepted by ICMR 2025