中文

利用标签分布先验改进零样本模型

计算机视觉与模式识别 2022-12-02 v1 机器学习

摘要

用诸如人脸年龄或物体类别等属性标注大型图像数据集是繁琐的,有时甚至不可行。有监督机器学习方法提供了高精度的解决方案,但需要通常不可得的手动标签。零样本模型(如CLIP)不需要手动标签,但不如有监督模型准确,尤其在属性为数值时。我们提出一种新方法CLIPPR(带先验的CLIP),将零样本模型适配于无标签数据集上的回归与分类。我们的方法不使用任何标注图像。相反,我们假设数据集中标签分布的先验。然后我们在CLIP之上训练一个适配器网络,基于两个竞争目标:i) 对原始CLIP模型预测的最小改变;ii) 预测标签分布与先验分布之间的最小距离。此外,我们提出一种利用分布先验为视觉与语言模型选择提示词的新方法。我们的方法有效,并相较原模型有显著改进。我们在UTK年龄回归任务上展示了平均绝对误差28%的改进。我们还在分类基准上给出了有前景的结果,在不使用任何标签的情况下将ImageNet数据集上的分类准确率提高了2.83%。

关键词

引用

@article{arxiv.2212.00784,
  title  = {Improving Zero-Shot Models with Label Distribution Priors},
  author = {Jonathan Kahana and Niv Cohen and Yedid Hoshen},
  journal= {arXiv preprint arXiv:2212.00784},
  year   = {2022}
}