中文

理解机器学习攻击中的数据重要性:有价值的数据是否会造成更大危害?

密码学与安全 2024-10-01 v1 机器学习

摘要

机器学习已彻底变革了多个领域,在推动进展和实现数据导向流程方面发挥着关键作用。数据在训练模型和塑造其性能方面的重要性不容小觑。近期研究已凸显单个数据样本的异质影响,尤其是存在大量数据显著贡献于模型的实用性和有效性的问题。然而,一个关键问题仍未得到解答:这些有价值的数据样本是否更容易受到机器学习攻击的威胁?本文通过分析五种不同类型的攻击,探讨了数据重要性与机器学习攻击之间的关系。我们的发现揭示了若干见解。例如,我们观察到高重要性数据样本在某些攻击(如成员推断和模型窃取)中表现出更高的脆弱性。通过分析成员推断脆弱性与数据重要性之间的关联,我们展示了样本特征可被整合到成员指标中,通过引入样本特定标准,从而提高成员推断性能。这些发现强调了迫切需要创新防御机制,以在最大化实用性和保护有价值数据免受潜在剥削之间取得平衡的迫切需求。

关键词

引用

@article{arxiv.2409.03741,
  title  = {Understanding Data Importance in Machine Learning Attacks: Does Valuable Data Pose Greater Harm?},
  author = {Rui Wen and Michael Backes and Yang Zhang},
  journal= {arXiv preprint arXiv:2409.03741},
  year   = {2024}
}

备注

To Appear in Network and Distributed System Security (NDSS) Symposium 2025