大规模删除鲁棒的次模最大化
机器学习
2017-11-22 v2 数据结构与算法
摘要
我们能否在保护用户隐私和/或确保代表性公平的同时,从大型用户生成数据集中高效提取有用信息?我们将此问题归结为一类删除鲁棒的次模最大化问题,其中部分数据可能因隐私顾虑或公平性准则而被删除。我们提出了首个内存高效的集中式、流式与分布式方法,针对任意数量的对抗性删除提供常数因子近似保证。我们在实际应用上针对先前最优方法广泛评估了我们的算法性能,包括(i)带位置隐私约束的 Uber 上车点位置;(ii)用于收入预测与犯罪率预测的带公平性约束的特征选择;以及(iii)对包含 2,458,285 个特征向量的普查数据进行的删除鲁棒摘要。
引用
@article{arxiv.1711.07112,
title = {Deletion-Robust Submodular Maximization at Scale},
author = {Ehsan Kazemi and Morteza Zadimoghaddam and Amin Karbasi},
journal= {arXiv preprint arXiv:1711.07112},
year = {2017}
}
备注
27 pages, 3 figures