中文

应对表格数据领域中对抗攻击与防御的关键挑战:连贯性与一致性的方法论框架

机器学习 2025-09-03 v3

摘要

在表格数据上训练的机器学习模型容易受到对抗攻击,即使在攻击者仅能访问模型输出的真实场景中也是如此。由于表格数据包含特征之间的复杂依赖关系,对抗样本必须保持连贯性并尊重这些依赖关系,才能与良性数据无法区分。此外,现有的攻击评估指标(如成功率、扰动幅度和查询次数)未能应对这一挑战。为弥补这些不足,我们提出了一种在保持样本连贯性的同时扰动依赖特征的技术。此外,我们引入了类别特定异常检测(Class-Specific Anomaly Detection, CSAD),一种有效的新型异常检测方法,以及用于评估表格对抗攻击质量的具体指标。CSAD 相对于其预测类别分布来评估对抗样本,而非宽泛的良性分布。这确保了在其他类别中看似连贯的细微对抗扰动能够被正确识别为异常。我们整合了 SHAP 可解释性技术来检测模型决策中的不一致性,将 CSAD 扩展为基于 SHAP 的异常检测。我们的评估结合了异常检测率与基于 SHAP 的评估,以提供对抗样本质量的更全面衡量。我们评估了多种攻击策略,在四个目标模型上考察了基于黑盒查询的攻击和基于迁移性的梯度攻击。在基准表格数据集上的实验揭示了攻击者的风险与努力以及攻击质量之间的关键差异,为攻击者和防御者面临的优势、局限性与权衡提供了见解。我们的研究结果为表格领域对抗攻击与防御的未来研究奠定了基础。

关键词

引用

@article{arxiv.2412.07326,
  title  = {Addressing Key Challenges of Adversarial Attacks and Defenses in the Tabular Domain: A Methodological Framework for Coherence and Consistency},
  author = {Yael Itzhakev and Amit Giloni and Yuval Elovici and Asaf Shabtai},
  journal= {arXiv preprint arXiv:2412.07326},
  year   = {2025}
}