中文

基于 DPP 的公平且多样的数据摘要

机器学习 2018-02-13 v1 计算机与社会 信息检索 机器学习

摘要

在特征空间中按多样性比例选取数据子集的采样方法在数据摘要中很流行。然而,近期研究注意到此类数据摘要方法中会出现偏差(某些性别或种族的代表性不足或过度)。在本文中,我们开启了对给定数据集输出多样且公平摘要这一问题的研究。我们采用一种被广泛研究的多样性行列式度量及相应分布(DPP),并提出一个框架,使我们能将一般类的公平约束纳入此类分布中。然而,提出高效算法从这些受约束的行列式分布中采样面临复杂性障碍,我们给出了一个在输入向量满足自然性质时具有可证明良好性能的快速采样器。我们在真实世界和图像数据集上的实验结果表明,加入公平约束后样本多样性与无约束情形相差不大,并且我们也提供了相应的理论解释。

关键词

引用

@article{arxiv.1802.04023,
  title  = {Fair and Diverse DPP-based Data Summarization},
  author = {L. Elisa Celis and Vijay Keswani and Damian Straszak and Amit Deshpande and Tarun Kathuria and Nisheeth K. Vishnoi},
  journal= {arXiv preprint arXiv:1802.04023},
  year   = {2018}
}

备注

A short version of this paper appeared in the workshop FAT/ML 2016 - arXiv:1610.07183