中文

追求数据-模型效率:识别群体性能上的数据外部性

机器学习 2022-11-14 v1 机器学习

摘要

构建可信、有效且负责任的机器学习系统,关键在于理解训练数据的差异与建模决策如何相互作用并影响预测性能。在这项工作中,我们试图更好地理解如何表征、检测并设计数据-模型的协同作用。我们关注一种特定类型的数据-模型低效现象,即添加来自某些来源的训练数据实际上会降低在人群关键子群体上评估的性能,我们将这种现象称为群体性能上的负数据外部性。这种外部性可能出现在标准学习设置中,并且根据训练集大小和模型大小之间的条件不同,其表现方式也可能不同。数据外部性直接意味着可行模型改进的下限,然而高效地改进模型需要理解潜在的数据-模型张力。从更广阔的视角来看,我们的结果表明,数据效率是准确且可信的机器学习的关键组成部分。

关键词

引用

@article{arxiv.2211.06348,
  title  = {Striving for data-model efficiency: Identifying data externalities on group performance},
  author = {Esther Rolf and Ben Packer and Alex Beutel and Fernando Diaz},
  journal= {arXiv preprint arXiv:2211.06348},
  year   = {2022}
}

备注

9 pages, 3 figures. Trustworthy and Socially Responsible Machine Learning (TSRML 2022) workshop co-located with NeurIPS 2022