面向无训练的开词汇属性检测的组合式缓存
计算机视觉与模式识别
2025-03-26 v1
摘要
属性检测对于许多计算机视觉任务至关重要,因为它使系统能够描述颜色、纹理和材料等属性。当前方法通常依赖耗时的标注过程,而这本质上受限于对象可在任意细节水平上描述(例如颜色 vs. 颜色阴色),导致标注者未仔细指示时产生歧义。此外,它们 operate within a predefined set of attributes(属性集合),降低了可扩展性和对 unforeseen downstream applications(不可预见的下游应用)的适应性。我们提出了组合式缓存(ComCa),一种无训练的方法,用于开词汇属性检测,以克服上述限制。ComCa仅需要目标属性列表和对象作为输入,利用 web 规模数据库和大型语言模型(LLM)来确定属性-对象兼容性,从而填充包含图像的辅助缓存。为account for属性的组合性质,缓存图像获得软属性标签。在推理时,这些标签基于输入图像与缓存图像之间的相似性进行聚合,以细化底层视觉-语言模型(VLM)的预测。重要的是,我们的方法与模型无关,兼容各种 VLM。实验在公开数据集上表明,ComCa显著优于零样本和基于缓存的基线方法,与最新的训练方法竞争,证明精心设计的无训练方法能够成功解决开词汇属性检测问题。
引用
@article{arxiv.2503.19145,
title = {Compositional Caching for Training-free Open-vocabulary Attribute Detection},
author = {Marco Garosi and Alessandro Conti and Gaowen Liu and Elisa Ricci and Massimiliano Mancini},
journal= {arXiv preprint arXiv:2503.19145},
year = {2025}
}
备注
CVPR 2025. Project website at https://comca-attributes.github.io/