中文

面向随机森林的机器遗忘

机器学习 2021-06-15 v2 机器学习

摘要

响应用户数据删除请求、移除噪声样本或删除损坏的训练数据,仅是想要从机器学习(ML)模型中删除实例的若干原因。然而,高效地从 ML 模型中移除这些数据通常十分困难。本文中,我们引入数据删除使能(DaRE)森林,一种随机森林的变体,能够以最小化的重训练实现训练数据的移除。森林中每棵 DaRE 树的模型更新是精确的,意味着从 DaRE 模型中移除实例所得模型与在更新后数据上从头重训练完全一致。DaRE 树利用随机性与缓存使数据删除高效。DaRE 树的上层使用随机节点,均匀随机地选择分裂属性与阈值。这些节点极少需要更新,因其仅极少依赖于数据。在较低层,分裂以贪心方式优化如基尼指数或互信息之类的分裂准则。DaRE 树在每个节点缓存统计量、在每个叶节点缓存训练数据,从而仅在数据被移除时更新必要的子树。对于数值属性,贪心节点在阈值的随机子集上优化,以便能在逼近最优阈值的同时维护统计量。通过调整贪心节点所考虑阈值的数量以及随机节点的数量,DaRE 树可在更高预测精度与更高效更新之间权衡。在 13 个真实世界数据集与 1 个合成数据集上的实验中,我们发现 DaRE 森林删除数据的速度比从头重训练快数个数量级,同时几乎不损失预测能力。

关键词

引用

@article{arxiv.2009.05567,
  title  = {Machine Unlearning for Random Forests},
  author = {Jonathan Brophy and Daniel Lowd},
  journal= {arXiv preprint arXiv:2009.05567},
  year   = {2021}
}

备注

29 pages, 5 figures, 9 tables, and 3 algorithms. Accepted at ICML 2021