Breiman 的两种文化:你不必选边站
机器学习
2021-04-27 v1 机器学习
统计方法学
摘要
Breiman 的经典论文将数据分析和建模描绘为两种文化之间的选择:数据建模者与算法建模者。宽泛地说,数据建模者使用具有良好理解理论性质的简单、可解释模型来分析数据。算法建模者优先考虑预测准确性,并使用更灵活的函数逼近来分析数据。这种二分法忽略了一类第三类模型——源自科学理论的机制模型(例如 ODE/SDE 模拟器)。机制模型编码了针对特定应用的数据科学知识。尽管这些类别代表了模型空间中的极端点,现代计算和算法工具使我们能够在这些点之间进行插值,产生灵活、可解释且科学知情的混合模型,这些模型可享有准确而鲁棒的预测,并解决 Breiman 所描述的数据分析问题,例如 Rashomon 效应与奥卡姆困境。在寻找模型空间中合适点方面仍存在挑战,关于如何组合模型组件以及每个组件在多大程度上影响推断有许多选择。
引用
@article{arxiv.2104.12219,
title = {Breiman's two cultures: You don't have to choose sides},
author = {Andrew C. Miller and Nicholas J. Foti and Emily B. Fox},
journal= {arXiv preprint arXiv:2104.12219},
year = {2021}
}
备注
Commentary to appear in a special issue of Observational Studies, discussing Leo Breiman's paper "Statistical Modeling: The Two Cultures" (https://doi.org/10.1214/ss/1009213726)