病理基础模型的通用与可迁移对抗扰动
计算机视觉与模式识别
2025-10-21 v1 机器学习
医学物理
摘要
我们引入 Universal and Transferable Adversarial Perturbations (UTAP) 用于病理基础模型,这揭示了其能力中关键漏洞。使用深度学习优化,UTAP 包含一个固定且微弱的噪声模式,当添加到病理图像上时,会系统性地干扰多个病理基础模型的特征表示能力。因此,UTAP 会导致下游任务中性能下降,这些任务利用基础模型,包括在广泛的未知数据分布上的误分类。除了削弱模型性能外,我们展示了 UTAP 的两个关键特征:(1) 通用性:其扰动可应用于各种视野范围,独立于 UTAP 开发所使用的数据集;(2) 可迁移性:其扰动能够成功降解各种外部、黑盒病理基础模型的性能——从未见过的模型。这两个特征表明,UTAP 不是与特定基础模型或图像数据集相关联的专用攻击,而是构成对各种新兴病理基础模型及其应用的广泛威胁。我们在多个数据集上对各种最先进的病理基础模型进行了系统评估,通过使用固定噪声模式对输入图像进行视觉几乎不可察觉的修改,导致其性能显著下降。这些强大的攻击的开发为模型鲁棒性评估建立了关键、高标准基准,凸显了需要发展防御机制的需求,并可能为对抗训练提供必要资产,以确保在病理学领域安全可靠地部署 AI。
引用
@article{arxiv.2510.16660,
title = {Universal and Transferable Attacks on Pathology Foundation Models},
author = {Yuntian Wang and Xilin Yang and Che-Yung Shen and Nir Pillar and Aydogan Ozcan},
journal= {arXiv preprint arXiv:2510.16660},
year = {2025}
}
备注
38 Pages, 8 Figures