ViTNF:利用神经场增强广义类别发现中的 Vision Transformer
计算机视觉与模式识别
2025-06-04 v1
摘要
广义类别发现是开放世界识别中备受关注的任务,旨在利用已知类数据识别未知类样本。通过预训练、元训练和微调,ViT 展现出卓越的少样本学习能力。其 MLP 头是一个前馈网络,与整个网络在同一过程中同步训练,在未充分利用特征提取器能力的同时增加了训练成本和难度。本文提出了一种新架构,用基于神经场的结构替换 MLP 头。我们首先提出一个新的静态神经场函数来描述神经场的活动分布,然后使用两个静态神经场函数构建一个高效的少样本分类器。该基于神经场的分类器由两个耦合的静态神经场组成。它通过其初级场存储支持样本的特征信息,通过其高级场存储已知类别,并通过跨场连接存储支持样本的类别信息。我们用所提出的 NF 分类器替换 MLP 头,形成新架构 ViTNF,并通过在源任务上预训练特征提取器并在元测试中用支持样本单独训练 NF 分类器,简化了三阶段训练模式,显著降低了 ViT 对训练样本的需求及模型训练难度。为增强模型识别新类别的能力,我们提供了一种确定初级场横向交互尺度的有效算法。实验结果表明,我们的模型在 CIFAR-100、ImageNet-100、CUB-200 和 Standard Cars 上超越了现有 SOTA 方法,在新类别和所有类别上分别实现了 19% 和 16% 的显著准确率提升,表明其在 GCD 中具有显著优势。
引用
@article{arxiv.2506.02367,
title = {ViTNF: Leveraging Neural Fields to Boost Vision Transformers in Generalized Category Discovery},
author = {Jiayi Su and Dequan Jin},
journal= {arXiv preprint arXiv:2506.02367},
year = {2025}
}
备注
22 pages, 3 figures