随机森林算法在 R 与 Python 中的随机性控制与可重复性研究
人工智能
2024-08-23 v1
摘要
在护肤品的安全性问题上,遵守监管标准至关重要,以保证消费者免受皮肤刺激风险的威胁。因此,毒理学家必须熟悉所有风险。这不仅适用于他们的日常工作,也适用于他们集成到其程序中的所有算法。鉴于此,确保算法可重复性成为必须解决的最关键的方面之一。然而,我们如何证明高度依赖随机性的算法(如随机森林)的稳健性?本报告中,我们将讨论将随机森林集成到眼科容忍度评估中的策略。我们将比较四个软件包:randomForest 和 Ranger(R 软件包),通过 SKRanger 适配到 Python,以及广泛使用的 Scikit-Learn 中的 RandomForestClassifier() 函数。我们的目标是研究影响随机森林算法结果的随机性参数和来源。通过设置可比的参数并使用相同的伪随机数生成器(PRNG),我们期望在各种随机森林算法实现中一致地再现结果。尽管如此,这一探索还揭示了随机性的隐藏层次,并指导我们理解为确保所有四种随机森林算法实现的可重复性所必需的关键参数。
引用
@article{arxiv.2408.12184,
title = {Randomness control and reproducibility study of random forest algorithm in R and Python},
author = {Louisa Camadini and Yanis Bouzid and Maeva Merlet and Léopold Carron},
journal= {arXiv preprint arXiv:2408.12184},
year = {2024}
}