中文

重新思考分布偏移:表格数据的实证分析与归纳建模

机器学习 2025-08-27 v5 人工智能

摘要

不同的分布偏移需要不同的干预,算法必须立足于其所针对的具体偏移。然而,鲁棒算法的方发展通常依赖于缺乏实证验证的结构性假设。我们倡导以实证为基础的、数据驱动的算法开发方法,构建了一个实证测试平台,涵盖8个表格数据集上的自然偏移、172个分布对、45种方法与90,000种方法配置,包括经验风险最小化与分布鲁棒优化(DRO)方法。我们发现YXY|X-偏移在我们的测试平台中最普遍,与ML文献中对XX(协变量)偏移的重度关注形成鲜明对比,且鲁棒算法的性能并不优于朴素方法。为理解原因,我们对DRO方法进行了深入实证分析,发现被忽视的实现细节——如下层模型类(如LightGBM)的选择与超参数选取——对性能的影响大于模糊集或其半径。我们通过案例研究说明,对分布偏移的数据驱动、归纳式理解如何为算法开发提供新途径。

关键词

引用

@article{arxiv.2307.05284,
  title  = {Rethinking Distribution Shifts: Empirical Analysis and Inductive Modeling for Tabular Data},
  author = {Tianyu Wang and Jiashuo Liu and Peng Cui and Hongseok Namkoong},
  journal= {arXiv preprint arXiv:2307.05284},
  year   = {2025}
}

备注

Conference version appeared in NeurIPS 2023, previously titled "On the Need for a Language Describing Distribution Shifts: Illustrations on Tabular Datasets"