中文

大规模删除鲁棒的次模最大化

机器学习 2017-11-22 v2 数据结构与算法

摘要

我们能否在保护用户隐私和/或确保代表性公平的同时,从大型用户生成数据集中高效提取有用信息?我们将此问题归结为一类删除鲁棒的次模最大化问题,其中部分数据可能因隐私顾虑或公平性准则而被删除。我们提出了首个内存高效的集中式、流式与分布式方法,针对任意数量的对抗性删除提供常数因子近似保证。我们在实际应用上针对先前最优方法广泛评估了我们的算法性能,包括(i)带位置隐私约束的 Uber 上车点位置;(ii)用于收入预测与犯罪率预测的带公平性约束的特征选择;以及(iii)对包含 2,458,285 个特征向量的普查数据进行的删除鲁棒摘要。

关键词

引用

@article{arxiv.1711.07112,
  title  = {Deletion-Robust Submodular Maximization at Scale},
  author = {Ehsan Kazemi and Morteza Zadimoghaddam and Amin Karbasi},
  journal= {arXiv preprint arXiv:1711.07112},
  year   = {2017}
}

备注

27 pages, 3 figures