后续差异描述:语言模型消解图像分类中的歧义
计算与语言
2024-03-18 v2 计算机视觉与模式识别
机器学习
摘要
一种用于提升 CLIP 等视觉语言模型在图像分类上性能的有前景的方法,是用相关属性扩展类描述(即提示),例如使用 brown sparrow 而非 sparrow。然而,当前的零样本方法无论目标类之间的共性如何都选择属性子集,可能提供无助于区分它们的有用信息。例如,它们可能使用颜色而非喙形来区分麻雀和鹪鹩,而二者均为棕色。我们提出后续差异描述(FuDD),一种零样本方法,其为每个数据集定制类描述并引出能更好区分目标类的附加属性。FuDD 首先识别每幅图像中的歧义类,然后使用大型语言模型(LLM)生成区分它们的新的类描述。新的类描述消解了初始歧义并有助于预测正确标签。在我们的实验中,FuDD 在 12 个数据集上持续优于通用描述集成和朴素 LLM 生成描述。我们表明差异描述是一种消解类歧义的有效工具,否则类歧义会显著降级性能。我们还表明 FuDD 生成的高质量自然语言类描述取得了与少样本自适应方法相当的性能。
引用
@article{arxiv.2311.07593,
title = {Follow-Up Differential Descriptions: Language Models Resolve Ambiguities for Image Classification},
author = {Reza Esfandiarpoor and Stephen H. Bach},
journal= {arXiv preprint arXiv:2311.07593},
year = {2024}
}
备注
ICLR 2024