中文

SPATA:用于详细且透明数据卡的系统化模式分析

机器学习 2025-10-01 v1 密码学与安全

摘要

由于人工智能 (AI) 对数据扰动和对抗样本的脆弱性,必须在部署任何机器学习 (ML) 模型前进行彻底的鲁棒性评估。然而,检查模型决策边界并识别潜在漏洞通常需要获取训练与测试数据,这可能带来数据隐私与机密性风险。为提升处理机密数据或关键基础设施的组织透明度,必须允许在不披露私私数据的情况下进行外部验证与验证。本文提出系统化模式分析 (SPATA),一种将任意表格数据转换为领域无关的统计模式表示的确定性方法,以提供更详细、更透明的数据卡。SPATA 计算每个数据实例在离散空间中的投影,从而可进行分析与比较,同时避免数据泄露风险。这些投影后的数据集可用于评估不同特征如何影响 ML 模型鲁棒性,并用于生成模型行为的可解释解释,促进更可信的 AI 系统。

关键词

引用

@article{arxiv.2509.26640,
  title  = {SPATA: Systematic Pattern Analysis for Detailed and Transparent Data Cards},
  author = {João Vitorino and Eva Maia and Isabel Praça and Carlos Soares},
  journal= {arXiv preprint arXiv:2509.26640},
  year   = {2025}
}

备注

16 pages, 3 tables, 6 figures, SynDAiTE, ECML PKDD 2025