DetailCLIP:将图像细节注入 CLIP 的特征空间
计算机视觉与模式识别
2026-04-23 v7
摘要
尽管 CLIP 类视觉语言模型为图像与文本提供了可用的联合特征空间,但由于 CLIP 类模型图像输入尺寸的限制(如 224),若输入高分辨率图像(如 2240),细微细节会在特征表示中丢失。我们提出的框架通过为高分辨率图像生成单一特征表示来解决此问题,该表示保留不同尺度的图像细节,同时与原始 CLIP 共享同一语义空间。一个应用场景是遥感文本-图像检索,其中目标(如车辆与船只)常以微小尺度出现。为此,我们开发了依赖从精心设计的图像块方法(称为 Complete Cover)提取的 CLIP 特征的特征融合模型。该方法确保跨各种尺度对物体的全面覆盖,并由与图像无关的类提示查询弱监督。我们使用真实与合成数据集评估框架性能,展示了基于类提示查询的图像检索任务的显著提升。为进一步展示框架在细节检索上的能力,我们引入了名为 CLVER-DS 的 CLEVR 类合成数据集。该全标注数据集提供可控物体尺度,便于更透彻地检验方法有效性。我们的代码公开于 https://github.com/zilunzhang/DetailCLIP
引用
@article{arxiv.2208.14649,
title = {DetailCLIP: Injecting Image Details into CLIP's Feature Space},
author = {Zilun Zhang and Cuifeng Shen and Yuan Shen and Xinyu Zhou and Huixin Xiong and Tiancheng Zhao and Jianwei Yin},
journal= {arXiv preprint arXiv:2208.14649},
year = {2026}
}