CountCLIP——[复现] 教CLIP数到十
计算机视觉与模式识别
2024-06-11 v2 人工智能
机器学习
摘要
大型视觉语言模型被证明可以学习丰富的联合图像-文本表示,从而在相关的下游任务中实现高性能。然而,它们未能展示对物体的定量理解,并且缺乏良好的计数感知表示。本文对“教CLIP数到十”(Paiss等人,2023)进行了可重复性研究,该研究提出了一种微调CLIP模型(Radford等人,2021)的方法,通过引入计数对比损失项,在保持零样本分类性能的同时,提高图像中零样本计数的准确性。我们在其训练数据的一个较小子集上,使用较低的计算资源改进了模型的性能。我们通过自己的代码复现他们的研究来验证这些说法。实现代码可在https://github.com/SforAiDl/CountCLIP找到。
引用
@article{arxiv.2406.03586,
title = {CountCLIP -- [Re] Teaching CLIP to Count to Ten},
author = {Harshvardhan Mestha and Tejas Agrawal and Karan Bania and Shreyas V and Yash Bhisikar},
journal= {arXiv preprint arXiv:2406.03586},
year = {2024}
}