中文

用于生成可靠分类假冒品的数字网络反演

机器学习 2025-09-03 v2 计算机视觉与模式识别

摘要

在视觉分类中,生成能够产生自信预测的输入对于理解模型行为和可靠性至关重要,尤其是在对抗性或离分布数据(OOD)条件下。虽然传统的对抗方法依赖对现有输入进行扰动以欺骗模型,但它们本质上是输入依赖的,往往难以同时确保高置信度和与训练数据之间的有意义偏差。在本工作中,我们扩展了网络反演技术,用于生成可靠分类假冒品(Confidently Classified Counterfeits, CCC),这些是模型尽管与训练分布显著不同且独立于任何特定输入而仍能对其进行自信分类的合成样本。我们修改了反演技术,方法是将软向量条件替换为独热类条件,并在独热标签与分类器输出分布之间引入克隆-戈尔克尔发散损失。CCC提供了一种关于置信度的模型中心视角,揭示了模型可以对完全合成的、离分布的输入赋予高置信度。这挑战了许多基于对置 prediction 置信度阈值的 OOD 检测技术的核心假设,这些技术假设高置信度输出意味着数据在分布内,从而凸显了在安全关键应用中更健壮的不确定性估计的需求。

关键词

引用

@article{arxiv.2503.20187,
  title  = {Network Inversion for Generating Confidently Classified Counterfeits},
  author = {Pirzada Suhail and Pravesh Khaparde and Amit Sethi},
  journal= {arXiv preprint arXiv:2503.20187},
  year   = {2025}
}