中文

MENTOR:面向泛化能力提升的人类感知引导预训练

计算机视觉与模式识别 2025-04-29 v3

摘要

将人类感知引入卷积神经网络(CNN)的训练,已提升了此类模型在开集识别任务中的泛化能力。一个活跃的研究问题是:在模型架构或训练流程的何处、以及如何高效地将总是有限的人类感知数据融入模型的训练策略中。本文提出 MENTOR(huMan pErceptioN-guided preTraining fOr increased geneRalization),通过两轮独特的 CNN 训练来解决该问题,所训 CNN 用于开集异常检测。首先,我们训练一个自编码器,在无需任何类别标签的情况下,根据输入图像学习人类显著性图。因此,自编码器被赋予发现模仿人类感知的域特定显著特征的任务。其次,我们移除解码器部分,在编码器顶部添加分类层,并使用类别标签以常规方式训练这一新模型。我们表明,与传统预训练方法(例如从 ImageNet 获取权重)以及将人类感知引导融入训练的最先进(SOTA)方法相比,MENTOR 在多种异常检测任务(展示了未知虹膜呈现攻击、合成生成人脸以及胸部 X 射线图像中异常的检测)中,成功提升了三种不同 CNN 骨干网络的泛化性能。此外,我们证明 MENTOR 可灵活应用于现有的人类感知引导方法,并在无需架构修改的情况下随后提升其泛化能力。

关键词

引用

@article{arxiv.2310.19545,
  title  = {MENTOR: Human Perception-Guided Pretraining for Increased Generalization},
  author = {Colton R. Crum and Adam Czajka},
  journal= {arXiv preprint arXiv:2310.19545},
  year   = {2025}
}

备注

10 pages, 3 figures, 5 tables