中文

基于置信度加权的多方法集成用于零样本图像分类

计算机视觉与模式识别 2024-05-06 v1

摘要

本文介绍了一种新颖的零样本学习(zero-shot learning, ZSL)框架,即识别训练期间未见过的类别,通过使用多模型和多对齐集成方法。具体来说,我们提出了三种策略来增强模型处理 ZSL 的性能:1)利用 ChatGPT 的广泛知识和 DALL-E 强大的图像生成能力来创建能够精确描述未见类别和分类边界的参考图像,从而缓解信息瓶颈问题;2)集成来自 CLIP 的文本-图像对齐和图像-图像对齐结果,以及来自 DINO 的图像-图像对齐结果,以实现更准确的预测;3)引入基于置信度的自适应加权机制来聚合不同预测方法的结果。在包括 CIFAR-10、CIFAR-100 和 TinyImageNet 在内的多个数据集上的实验结果表明,与单模型方法相比,我们的模型可以显著提高分类准确率,在所有测试数据集上实现了 96% 以上的 AUROC 分数,在 CIFAR-10 数据集上显著超过 99%。

关键词

引用

@article{arxiv.2405.02155,
  title  = {Multi-method Integration with Confidence-based Weighting for Zero-shot Image Classification},
  author = {Siqi Yin and Lifan Jiang},
  journal= {arXiv preprint arXiv:2405.02155},
  year   = {2024}
}