通过各向异性与局部性 disentangling safe 与 unsafe 损坏
计算机视觉与模式识别
2025-04-02 v3 机器学习
摘要
最先进的机器学习系统对输入的小扰动极其脆弱,其中“小”是根据威胁模型定义的,后者为每个扰动赋予正面的威胁值。大多数先前工作定义的是任务无关、各向同性和全局威胁,如 范数,扰动的大小完全决定威胁程度,攻击的方向及其在空间中的位置均不 matter。然而,计算机视觉中的常见损坏,如模糊、压缩或遮挡,无法被此类威胁模型很好地捕捉。本文提出一种新颖的威胁模型称为 \texttt{Projected Displacement} (PD),以研究超越现有各向同性和全局威胁模型的鲁棒性。该提出的威胁模型通过其与 \textit{unsafe directions}(不安全方向)的对齐程度来衡量扰动的威胁,后者是输入空间中的方向,沿该方向若干足够大的扰动会改变 ground truth 类标签。在训练数据的观察基础上,针对每个输入局部识别不安全方向。如此,PD 威胁模型表现出各向异性和局部性。在 Imagenet-1k 数据上的实验表明,对于任意输入,PD 威胁较小的扰动集合包括 范数较大的 \textit{safe} 扰动,如噪声、模糊和压缩,可保留真实标签,同时排除了会改变真实标签的 \textit{unsafe} 扰动。不同于基于大型视觉模型嵌入的感知威胁模型,PD 威胁模型可在没有预训练或微调的情况下,用于任意分类任务的计算。进一步地,诸如对图像区域敏感性或概念层次结构等额外任务注释可轻松集成到威胁评估中,从而使 PD 威胁模型为从业者提供灵活、任务驱动的威胁规格。
引用
@article{arxiv.2501.18098,
title = {Disentangling Safe and Unsafe Corruptions via Anisotropy and Locality},
author = {Ramchandran Muthukumar and Ambar Pal and Jeremias Sulam and Rene Vidal},
journal= {arXiv preprint arXiv:2501.18098},
year = {2025}
}
备注
Published at IEEE/CVF Conference on Computer Vision and Pattern Recognition 2025. Updated Acknowledgements