整体鲁棒的数据驱动决策
机器学习
2025-02-04 v4 机器学习
摘要
设计具有良好样本外表现的机器学习与决策数据驱动公式是一项关键挑战。良好的样本内表现并不能保证良好的样本外表现,这一观察通常被称为过拟合。实际的过拟合通常不能归因于单一原因,而是由若干因素同时造成。我们在此考虑三种过拟合来源:(i) 由于使用有限样本数据导致的统计误差,(ii) 数据噪声,即数据点仅以有限精度测量时出现的情况,以及 (iii) 数据误指定,其中所有数据的一小部分可能完全被损坏。尽管现有的数据驱动公式可能对这三种来源中的某一种单独具有鲁棒性,但它们不能同时提供针对所有过拟合来源的整体保护。我们设计了一种新颖的数据驱动公式,可保证此类整体保护且计算可行。我们的分布鲁棒优化公式可解释为Kullback-Leibler与Lévy-Prokhorov鲁棒优化公式的新颖组合。在分类与回归问题背景下,我们表明若干流行的正则化与鲁棒公式自然归约为我们所提新颖公式的特例。最后,我们将所提出的HR公式应用于两个实际应用场景,并与若干基准进行比较研究:(1) 在医疗数据上训练神经网络,分析在噪声、标注错误与数据稀缺情况下的各种鲁棒性与泛化性质;(2) 使用真实股票数据的投资组合选择问题,并分析该应用自然出现的严重分布偏移下的风险/收益权衡。
引用
@article{arxiv.2207.09560,
title = {Holistic Robust Data-Driven Decisions},
author = {Amine Bennouna and Bart Van Parys and Ryan Lucas},
journal= {arXiv preprint arXiv:2207.09560},
year = {2025}
}