关键在于混合:具有混合特征的 Wasserstein 分类与回归
最优化与控制
2025-10-10 v3 机器学习
摘要
问题定义:监督学习中的一个关键挑战是数据稀缺,这可能导致预测模型对训练数据过拟合并在样本外表现不佳。应对过拟合的一种现代方法是分布鲁棒问题公式化,该方法考虑所有接近由历史样本导出的经验分布的数据生成分布,其中“接近度”由 Wasserstein 距离确定。虽然此类公式在所有输入特征均为连续的预测任务中显示出显著前景,但在存在离散特征时其计算规模呈指数级增长。方法/结果:我们证明了分布鲁棒混合特征分类和回归问题确实可以在多项式时间内求解。我们的证明依赖于经典的基于椭球法的求解方案,但这些方案在实际中扩展性不佳。为了克服这一限制,我们开发了一种实际高效(尽管在最坏情况下为指数时间)的基于割平面的算法,该算法拥有多项式时间的分离预言机,尽管存在指数级数量的约束。我们在标准基准实例上从理论和实证两方面将我们的方法与替代技术进行了比较。管理启示:数据驱动的运营管理问题通常涉及具有离散特征的预测模型。我们开发并分析了分布鲁棒预测模型,这些模型忠实地考虑了离散特征的存在,并且我们从理论上和在标准基准实例上证明了我们的模型显著优于那些忽略离散特征存在的现有方法。
引用
@article{arxiv.2312.12230,
title = {It's All in the Mix: Wasserstein Classification and Regression with Mixed Features},
author = {Reza Belbasi and Aras Selvi and Wolfram Wiesemann},
journal= {arXiv preprint arXiv:2312.12230},
year = {2025}
}
备注
61 pages (34 main + proofs), 8 tables, 2 colored plots, an early version appeared in NeurIPS 2022 main track (arXiv 2205.13501)