中文

数据集多重性问题:不可靠数据如何影响预测

机器学习 2023-04-24 v1 计算机与社会

摘要

我们引入数据集多重性,一种研究训练数据集中的不准确、不确定性和社会偏见如何影响测试时预测的方法。数据集多重性框架提出一个反事实问题:如果我们能以某种方式获取数据集所有假设的、无偏的版本,所得的模型集合(及相关的测试时预测)会是什么。我们讨论如何使用该框架来封装数据集事实性中各类不确定性的来源,包括系统性社会偏见、数据收集实践以及噪声标签或特征。我们展示了如何针对特定模型架构和不确定性类型——带有标签误差的线性模型——精确分析数据集多重性的影响。我们的实证分析表明,在合理假设下,真实世界数据集包含许多其预测受数据集多重性影响的测试样本。此外,领域特定的数据集多重性定义的选择决定了哪些样本受影响,以及不同人口群体是否受到差异性影响。最后,我们讨论了数据集多重性对机器学习实践与研究的启示,包括何时不应信任模型输出的考量。

关键词

引用

@article{arxiv.2304.10655,
  title  = {The Dataset Multiplicity Problem: How Unreliable Data Impacts Predictions},
  author = {Anna P. Meyer and Aws Albarghouthi and Loris D'Antoni},
  journal= {arXiv preprint arXiv:2304.10655},
  year   = {2023}
}

备注

25 pages, 8 figures. Accepted at FAccT '23