树内列子采样阻碍XGBoost学习比率型交互作用
机器学习
2026-01-14 v1
摘要
许多应用问题中的信号只有在组合多个原始测量值后才变得清晰。比率和速率是常见的例子。在梯度提升树中,这种组合并非显式操作:模型必须通过组件特征上的协调分裂来综合它。我们研究了XGBoost中的树内列子采样是否使这种综合变得更加困难。我们使用了两个具有抵消结构的合成数据生成过程。在这两个过程中,两个原始特征共享一个强干扰因子,而目标依赖于一个较小的差分因子。对数比率抵消了干扰并隔离了信号。我们将colsample_bylevel和colsample_bynode在{0.4, 0.6, 0.8, 0.9}范围内变化,重点关注轻度子采样(s >= 0.8)。一个控制特征集包括工程化的比率,消除了综合的需要。在两个过程中,树内列子采样降低了仅原始特征设置下的测试PR-AUC。在主过程中,当两个参数都设置为0.4时,相对下降达到54%。当存在工程化比率时,这种效应基本消失。基于路径的共使用度量在性能下降的相同单元中下降。实际上,如果比率型结构是合理的,要么避免树内子采样,要么包含预期的比率特征。
引用
@article{arxiv.2601.08121,
title = {Intra-tree Column Subsampling Hinders XGBoost Learning of Ratio-like Interactions},
author = {Mykola Pinchuk},
journal= {arXiv preprint arXiv:2601.08121},
year = {2026}
}
备注
14 pages, 11 figures and tables