Wasserstein 测度核心集
机器学习
2020-03-04 v2 机器学习
摘要
大型数据集与贝叶斯推断技术的激增激发了对更好数据稀疏化的需求。核心集(coresets)提供了一种原则性的方式,通过较小的数据集来概括大型数据集,并确保在特定问题上与完整数据集的性能相匹配。然而,经典核心集忽略了底层的数据分布,而该分布通常是连续的。我们通过引入 Wasserstein 测度核心集来解决这一疏忽,它是核心集的一种扩展,其定义本身就考虑了泛化能力。我们对问题的表述本质上在于最小化 Wasserstein 距离,可通过随机梯度下降求解。这产生了一种算法,仅需对数据分布进行采样访问,并能够以在线方式处理大型数据流。我们在推断与聚类中验证了我们的构造。
引用
@article{arxiv.1805.07412,
title = {Wasserstein Measure Coresets},
author = {Sebastian Claici and Aude Genevay and Justin Solomon},
journal= {arXiv preprint arXiv:1805.07412},
year = {2020}
}