中文

基于集成方法考察随机森林对非定向数据投毒的鲁棒性

机器学习 2025-04-11 v3

摘要

机器学习正变得无处不在。从金融到医学,机器学习模型正在促进决策过程,甚至在某些任务中超越人类。然而,预测质量上的巨大进步并未在此类模型及相应预测的安全性方面得到对应体现,其中训练集部分被扰动(投毒)会严重损害模型精度。过去十年中,关于投毒攻击与防御的研究受到越来越多的关注,产生了若干旨在提升机器学习鲁棒性的有前景的方案。其中,基于集成(ensemble-based)的防御方法在不同的训练集子集上训练不同模型并聚合其预测,以线性开销为代价提供了强有力的理论保证。令人惊讶的是,不对基模型施加任何限制的基于集成的防御尚未被应用于提升随机森林模型的鲁棒性。本文旨在填补这一空白,通过设计并实施一种新颖的基于哈希的集成方法,保护随机森林免受非定向、随机投毒攻击。广泛的实验评估衡量了我们的方法针对多种攻击的性能,以及其在资源消耗与性能方面的可持续性,并与基于随机森林的传统单体模型进行比较。最后的讨论给出了我们的主要发现,并将我们的方法与现有的面向随机森林的投毒防御进行了比较。

关键词

引用

@article{arxiv.2209.14013,
  title  = {On the Robustness of Random Forest Against Untargeted Data Poisoning: An Ensemble-Based Approach},
  author = {Marco Anisetti and Claudio A. Ardagna and Alessandro Balestrucci and Nicola Bena and Ernesto Damiani and Chan Yeob Yeun},
  journal= {arXiv preprint arXiv:2209.14013},
  year   = {2025}
}

备注

Accepted in IEEE Transactions on Sustainable Computing; 15 pages, 8 figures