中文

CICA:用于零样本文档图像分类的内容注入对比对齐

计算机视觉与模式识别 2024-05-07 v1

摘要

零样本学习在更广泛的视觉识别领域已被广泛研究,近期引起了极大关注。然而,目前关于文档图像分类中零样本学习的工作仍然稀缺。现有研究要么仅专注于零样本推理,要么其评估不符合视觉识别领域既有的零样本评估标准。为了弥补这一空白,我们在零样本学习和广义零样本学习设置下提供了全面的文档图像分类分析。我们的方法和评估与该领域既有的实践相一致。此外,我们提出了 RVL-CDIP 数据集的零样本划分。进一步地,我们引入了 CICA(发音为 'ki-ka'),这是一个增强 CLIP 零样本学习能力的框架。CICA 包含一个新颖的“内容模块”,旨在利用任何通用的文档相关文本信息。该模块提取的判别特征使用一种新颖的“耦合对比”损失与 CLIP 的文本和图像特征进行对齐。在 RVL-CDIP 数据集上,我们的模块将 CLIP 的零样本学习 top-1 准确率提高了 6.7%,将广义零样本学习的调和平均值提高了 24%。我们的模块是轻量级的,仅给 CLIP 增加了 3.3% 的参数。我们的工作为零样本文档分类的未来研究指明了方向。

关键词

引用

@article{arxiv.2405.03660,
  title  = {CICA: Content-Injected Contrastive Alignment for Zero-Shot Document Image Classification},
  author = {Sankalp Sinha and Muhammad Saif Ullah Khan and Talha Uddin Sheikh and Didier Stricker and Muhammad Zeshan Afzal},
  journal= {arXiv preprint arXiv:2405.03660},
  year   = {2024}
}

备注

18 Pages, 4 Figures and Accepted in ICDAR 2024