中文

通过 OOD 检测理解视觉 Transformer 的鲁棒性

计算机视觉与模式识别 2026-02-03 v1 人工智能 机器学习

摘要

视觉 Transformer 在视觉任务中展现出卓越的性能,但在可及且实时应用场景中仍面临挑战。量化可降低内存和推理成本,但以性能损失为代价。目前通过理解分布内 (ID) 任务行为来缓解低精度问题的措施已取得进展,但注意力机制可能通过探索分布外 (OOD) 情况提供关于量化特性的洞见。我们研究了量化后的小变体主流视觉 Transformer (DeiT、DeiT3 和 ViT) 在常见 OOD 数据集上的行为。ID 分析显示,4 位模型存在初始不稳定性,尤其是那些在更大规模 ImageNet-22k 上训练的模型,因 DeiT3 作为最强的 FP32 模型,量化误差导致性能下降 17%,成为最弱的 4 位模型之一。尽管 ViT 在 ID 校准方面表现出相对稳健的量化鲁棒性,但 OOD 检测揭示了更多信息:在 ImageNet-22k 上预训练的 ViT 和 DeiT3 分别在 AUPR-out 从全精度到 4 位之间出现 15.0% 和 19.2% 的平均量化 delta,而它们仅使用 ImageNet-1k 的对手出现 9.5% 和 12.0% 的 delta。总体而言,我们的结果表明,在 OOD 检测中,大规模数据集的预训练可能阻碍低位量化鲁棒性,而数据增强可能是更有益的选择。

关键词

引用

@article{arxiv.2602.01459,
  title  = {Understanding vision transformer robustness through the lens of out-of-distribution detection},
  author = {Joey Kuang and Alexander Wong},
  journal= {arXiv preprint arXiv:2602.01459},
  year   = {2026}
}

备注

Accepted to JCVIS 2025