中文

使用带额外检测头的视觉 Transformer 进行开放集识别

计算机视觉与模式识别 2022-03-17 v1 人工智能

摘要

深度神经网络在封闭集设定下的图像分类任务中已展现出卓越能力,其中测试数据与训练数据来自同一分布。然而,在更现实的开放集场景中,具备不完全知识的传统分类器无法处理来自训练类别之外的测试数据。开放集识别(OSR)旨在同时识别未知类别和区分已知类别以解决该问题。本文提出了一种基于视觉 Transformer(ViT)技术的 OSR 新方法。具体而言,我们的方法采用两个独立的训练阶段。首先,训练一个 ViT 模型执行封闭集分类。然后,将一个额外的检测头连接到由 ViT 提取的嵌入特征上,训练以迫使已知数据的表示紧凑地聚为类特定的簇。测试样本根据其到簇中心的距离被识别为已知或未知。据我们所知,这是首次利用 ViT 用于 OSR 目的,并且我们针对多个 OSR 基准数据集的广泛评估表明,我们的方法显著优于其他基线方法并取得了新的最先进性能。

关键词

引用

@article{arxiv.2203.08441,
  title  = {Open Set Recognition using Vision Transformer with an Additional Detection Head},
  author = {Feiyang Cai and Zhenkai Zhang and Jie Liu and Xenofon Koutsoukos},
  journal= {arXiv preprint arXiv:2203.08441},
  year   = {2022}
}

备注

under review