多数有益聚类:面向运营决策的数据聚合
机器学习
2023-12-19 v2 应用统计
摘要
随着市场条件日益波动与产品创新迅速,大规模系统的运营决策需要求解数千个数据有限的问题。数据聚合被提出用于将各问题的数据结合起来,以改进通过单独求解这些问题所获得的决策。我们提出一种新颖的基于聚类的 Shrunken-SAA 方法,可在实施数据聚合方法时利用问题间的聚类结构。我们证明,随着问题数量增长,利用给定的问题间聚类结构比忽略该结构的数据聚合方法带来额外收益。当聚类结构未知时,我们表明揭示聚类结构——即便以损失若干数据点为代价——也可能是有益的,尤其在问题聚类间距离较大时。我们提出的方法在温和条件下可推广至一般代价函数。当问题数量变大时,我们所提方法的最优性间隙随聚类间距离呈指数下降。我们通过管理 newsvendor 系统的数值实验应用探究所提方法的性能。我们研究了问题实例间距离度量对基于聚类的 Shrunken-SAA 方法在合成数据上性能的影响。我们进一步用真实数据验证所提方法,并突显基于聚类的数据聚合的优势,尤其在小型数据大规模情形下,相较于现有方法。
引用
@article{arxiv.2311.17326,
title = {Mostly Beneficial Clustering: Aggregating Data for Operational Decision Making},
author = {Chengzhang Li and Zhenkang Peng and Ying Rong},
journal= {arXiv preprint arXiv:2311.17326},
year = {2023}
}