中文

特征选择能否抵御训练数据投毒?

机器学习 2018-04-24 v1 密码学与安全 计算机科学与博弈论 机器学习

摘要

在对抗性环境中的学习正成为重要任务,适用于攻击者可能将恶意数据注入训练集以破坏数据驱动技术正常运作的应用领域。特征选择已广泛用于安全领域的机器学习中以改善泛化与计算效率,尽管尚不清楚当训练数据被智能攻击者投毒时其使用是否有益甚至适得其反。在这项工作中,我们提供一个框架以研究流行特征选择方法(包括 LASSO、岭回归和弹性网络)的鲁棒性,从而阐明此问题。我们在恶意软件检测上的结果表明,特征选择方法在攻击下可被显著破坏(通过精心插入少于 5% 的投毒训练样本,我们可将 LASSO 降至几乎随机的特征集选择),突显了特定对策的必要性。

关键词

引用

@article{arxiv.1804.07933,
  title  = {Is feature selection secure against training data poisoning?},
  author = {Huang Xiao and Battista Biggio and Gavin Brown and Giorgio Fumera and Claudia Eckert and Fabio Roli},
  journal= {arXiv preprint arXiv:1804.07933},
  year   = {2018}
}