中文

高尔达金的折磨:劇影与对抗性脆弱性

机器学习 2024-10-21 v1 人工智能 计算机视觉与模式识别

摘要

许多机器学习(ML)分类器声称超越人类,但仍会做出人类不会的错误。最著名的错误示例是对抗性视觉拟像。本文旨在定义和探讨对抗性劇影(AD)现象,包括对抗性视觉拟像,并比较机器学习分类器与人类性能。我们发现,AD是指对于本文中定义的感知度量而言彼此接近的输入。AD在质量上不同于常规对抗性示例。绝大多数分类器对AD都具有脆弱性,鲁棒性-精度权衡可能无法改善它们。某些分类问题可能无法实现任何AD鲁棒分类器,因为底层类别存在模糊性。我们提供了可用以确定分类问题是否 well-defined 的标准;描述AD鲁棒分类器的结构和属性;引入并探讨概念熵和概念模糊区域的概念,用于易受AD攻击的分类器,以及限制AD误导率的方法。我们定义表现出高度敏感行为的分类器概念,即仅会犯错的是对抗性劇影的分类器。提高高度敏感分类器的AD鲁棒性等同于提高精度。我们确定了保证准确率足够高的所有分类器均为高度敏感的条件。我们的发现旨在显著提升机器学习系统的可靠性和安全性。

关键词

引用

@article{arxiv.2410.13193,
  title  = {Golyadkin's Torment: Doppelg\"angers and Adversarial Vulnerability},
  author = {George I. Kamberov},
  journal= {arXiv preprint arXiv:2410.13193},
  year   = {2024}
}