Wasserstein距离与总变差距离的次线性算法:应用于公平性与隐私审计
机器学习
2025-06-19 v2 计算机与社会
数据结构与算法
统计计算
摘要
在仅能访问样本的情况下,资源高效地计算概率分布的表示及其之间的距离,是数学科学中一个基本且有用的问题。在本文中,我们提出了一种通用框架,用于在样本以流式方式到达时学习亚韦伯分布(即几乎所有轻尾或重尾分布)的概率分布函数(PDF)和累积分布函数(CDF)。其思想是将这些问题简化为估计一个适当选择的、经过适当离散化的分布支撑集中元素的频率。我们利用这种简化,从样本流中计算分布的可合并摘要,同时仅需要相对于观测样本数量的次线性空间。这使我们能够在样本以流式方式到达并来自多个来源时估计任意两个分布之间的 Wasserstein 距离和总变差(TV)距离。我们的算法显著改进了现有方法在距离估计方面带来的超线性时间和线性空间复杂度,并进一步将可合并摘要框架扩展到具有可能无限支撑的连续分布。我们的结果相对于有界离散分布的现有下界是紧致的。此外,我们利用所提出的 Wasserstein 和 TV 距离估计器来严格审计算法的公平性和隐私性。我们在合成和真实数据集上经验性地证明了所提出算法的效率。
引用
@article{arxiv.2503.07775,
title = {Sublinear Algorithms for Wasserstein and Total Variation Distances: Applications to Fairness and Privacy Auditing},
author = {Debabrota Basu and Debarshi Chanda},
journal= {arXiv preprint arXiv:2503.07775},
year = {2025}
}