揭示 AI 的盲点:用于预测类内、类外及对抗性错误的神谕系统
机器学习
2025-05-27 v3
摘要
AI 模型在识别图像时会发生错误,无论是类内错误、类外错误还是对抗性错误。预测这些错误对于提高系统可靠性、减少昂贵的错误、以及在医疗、金融和自主系统等实际应用中实现主动纠错至关重要。然而,了解 AI 模型会发生何种错误、为何会发生这些错误,以及如何预测这些错误仍是一个开放的挑战。本文我们使用一种“师傅”模型——一种 designed to predict another “徒弟” model errors 的深度神经网络——进行了全面的经验评估。我们的发现表明,师傅模型在学习徒弟模型在对抗性图像上(带有小扰动)的错误方面表现出色,并且能有效地预测徒弟模型的类内和类外错误。此外,基于 Transformer 的师傅模型在各种徒弟架构上预测错误方面表现优异。随后,我们从这些观察中提取见解,开发了一种“神谕”师傅模型,称为 SuperMentor,能够在 ImageNet-1K 数据集上超越基线师傅模型在不同错误类型上的预测能力。我们的框架为未来的研究提供了可能,以 anticipation and 纠正 AI 模型行为,从而增加对 AI 系统信任。
引用
@article{arxiv.2410.02384,
title = {Unveiling AI's Blind Spots: An Oracle for In-Domain, Out-of-Domain, and Adversarial Errors},
author = {Shuangpeng Han and Mengmi Zhang},
journal= {arXiv preprint arXiv:2410.02384},
year = {2025}
}