基于描述的真正分类:扩展CLIP在部件属性识别上的极限
计算机视觉与模式识别
2024-12-19 v1
摘要
在本研究中,我们定义并解决了零样本“真正”基于描述的分类这一新任务,该任务评估视觉语言模型(如CLIP)仅基于描述性属性(不包括对象类别名称)对对象进行分类的能力。这种方法凸显了当前VLM在理解复杂对象描述方面的局限性,推动这些模型超越单纯的对象识别。为促进这一探索,我们引入了一个新挑战,并为六个流行的细粒度基准发布了描述数据,这些数据省略了对象名称,以鼓励研究社区进行真正的零样本学习。此外,我们提出了一种方法,通过使用ImageNet21k的多样化对象类别,结合大语言模型生成的丰富属性描述进行针对性训练,来增强CLIP的属性检测能力。进一步地,我们引入了一种改进的CLIP架构,利用多分辨率来提高细粒度部件属性的检测。通过这些努力,我们拓宽了对CLIP中部件属性识别的理解,在六个流行基准以及广泛使用的对象属性识别基准PACO数据集上,提升了其在细粒度分类任务中的性能。代码见:https://github.com/ethanbar11/grounding_ge_public。
引用
@article{arxiv.2412.13947,
title = {Real Classification by Description: Extending CLIP's Limits of Part Attributes Recognition},
author = {Ethan Baron and Idan Tankel and Peter Tu and Guy Ben-Yosef},
journal= {arXiv preprint arXiv:2412.13947},
year = {2024}
}