中文

Lumberjack:通过树中的重点检测改进的差分隐私随机森林

机器学习 2026-05-22 v1 数据结构与算法

摘要

随机森林在涉及敏感表格数据的领域中广泛使用,但现有方法实现差分隐私通常会导致性能下降,难以实际应用。在本文中,我们引入 Lumberjack,这是一种差分隐私随机森林算法,通过构建大型随机决策树并施加激进的隐私保留修剪仅保留足够填充的子节点,从而实现显著提升的实用性。我们方法的关键组件是一种 novel 的 (ε,δ)(\varepsilon,\delta)-DP 重点检测算法,用于分层数据,其误差为 Oε,δ(logh)O_{\varepsilon,\delta}(\sqrt{\log h}),其中 hh 为树的高度,可能独立具有兴趣。这种有利的规模使我们能够使用远超前工作的更深树,从而在隐私约束下提高表达能力。我们的实证评估在基准数据集上显示,Lumberjack 在各类数据集上均一致优于先前的差分隐私随机森林方法,树立了新的实用性能标杆。特别是,我们的方法在实际隐私预算下显著改善了隐私-效用权衡。我们的发现表明,仔细设计的差分隐私随机森林能够缩小大量实用性能差距,凸显了未来研究的前景且尚未得到充分探索的方向。

关键词

引用

@article{arxiv.2605.22756,
  title  = {Lumberjack: Better Differentially Private Random Forests through Heavy Hitter Detection in Trees},
  author = {Christian Janos Lebeda and David Erb and Tudor Cebere and Aurélien Bellet},
  journal= {arXiv preprint arXiv:2605.22756},
  year   = {2026}
}