面向低资源域的检索增强零样本图像分类
计算机视觉与模式识别
2024-11-05 v1
摘要
低资源域以数据与标注稀缺为特征,给语言与视觉理解任务带来显著挑战,其中视觉任务在文献中鲜有探索。视觉-语言模型(VLM)近期在高资源域取得了有希望的结果,但在预训练集中表现不足的低资源概念(如每类仅有少量图像)上表现不佳。我们从新视角应对零样本低资源图像分类这一极具挑战性的任务。通过利用基于检索的策略,我们以免训练方式实现了这一目标。具体而言,我们的方法名为 CoRE(检索增强组合),通过从大规模网络爬取数据库中检索相关文本信息,丰富查询图像与类原型的表示。这种基于检索的增强通过引入与特定类别相关的更广泛上下文信息,显著提升了分类性能。我们在一个涵盖医学影像、稀有植物和电路等多样化低资源域的新建基准上验证了该方法。实验表明,CoRE 优于依赖合成数据生成和模型微调的现有最先进方法。
引用
@article{arxiv.2411.00988,
title = {Retrieval-enriched zero-shot image classification in low-resource domains},
author = {Nicola Dall'Asen and Yiming Wang and Enrico Fini and Elisa Ricci},
journal= {arXiv preprint arXiv:2411.00988},
year = {2024}
}
备注
Accepted to EMNLP 2024 (Main)