利用层次感知语言提示在基于 CLIP 的零样本分类中犯更好的错误
计算机视觉与模式识别
2025-03-05 v1
摘要
近期的研究利用在广泛互联网爬取文本数据上训练的大型语言模型(LLM)来生成 CLIP 零样本图像分类中下游类别的文本描述。尽管这些方法大多旨在提高准确率,但我们的工作聚焦于“犯更好的错误”,即错误的严重程度源自下游任务给定的标签层次。由于 CLIP 的图像编码器由语言监督信号训练,其隐式地捕捉了不同类别间的层次语义关系。这促使我们确立了在零样本分类中犯更好错误的目标,而 CLIP 天然适合此任务。我们的方法查询语言模型以生成给定类别的文本表示,作为 CLIP 的零样本分类器在下游任务上执行图像分类。据我们所知,这是首个在基于 CLIP 的零样本分类中引入犯更好错误理念的工作。在我们的实验中,该方法在具有不同高度标签层次的五个不同规模数据集上的综合比较中优于相关方法。我们的代码与 LLM 生成的图像提示:\href{https://github.com/ltong1130ztr/HAPrompts}{https://github.com/ltong1130ztr/HAPrompts}。
引用
@article{arxiv.2503.02248,
title = {Making Better Mistakes in CLIP-Based Zero-Shot Classification with Hierarchy-Aware Language Prompts},
author = {Tong Liang and Jim Davis},
journal= {arXiv preprint arXiv:2503.02248},
year = {2025}
}
备注
20 pages