中文

面向低资源域的检索增强零样本图像分类

计算机视觉与模式识别 2024-11-05 v1

摘要

低资源域以数据与标注稀缺为特征,给语言与视觉理解任务带来显著挑战,其中视觉任务在文献中鲜有探索。视觉-语言模型(VLM)近期在高资源域取得了有希望的结果,但在预训练集中表现不足的低资源概念(如每类仅有少量图像)上表现不佳。我们从新视角应对零样本低资源图像分类这一极具挑战性的任务。通过利用基于检索的策略,我们以免训练方式实现了这一目标。具体而言,我们的方法名为 CoRE(检索增强组合),通过从大规模网络爬取数据库中检索相关文本信息,丰富查询图像与类原型的表示。这种基于检索的增强通过引入与特定类别相关的更广泛上下文信息,显著提升了分类性能。我们在一个涵盖医学影像、稀有植物和电路等多样化低资源域的新建基准上验证了该方法。实验表明,CoRE 优于依赖合成数据生成和模型微调的现有最先进方法。

关键词

引用

@article{arxiv.2411.00988,
  title  = {Retrieval-enriched zero-shot image classification in low-resource domains},
  author = {Nicola Dall'Asen and Yiming Wang and Enrico Fini and Elisa Ricci},
  journal= {arXiv preprint arXiv:2411.00988},
  year   = {2024}
}

备注

Accepted to EMNLP 2024 (Main)