中文

谁该负责?联合量化学习算法与训练数据的贡献

机器学习 2021-05-04 v2 人工智能 机器学习

摘要

一个在数据集 DD 上训练的学习算法 AA 在测试时被发现对某个子群体表现不佳。责任应当归于何处?可以认为数据负有责任,例如,若在更具代表性的数据集 DD' 上训练 AA 本可改善性能。但同样也可以认为 AA 本身有过错,若在相同数据集 DD 上训练一个不同的变体 AA' 本可改善性能。随着机器学习变得普及且此类失败案例更为常见,这类问题正被证明远非假想。受此驱动,本文对学习算法 AA 与数据集 DD 之间的联合信用分配问题给出了严格的形式化。我们提出 Extended Shapley 作为该问题的原则性框架,并通过实证实验探讨其如何用于应对机器学习问责问题。

关键词

引用

@article{arxiv.1910.04214,
  title  = {Who's responsible? Jointly quantifying the contribution of the learning algorithm and training data},
  author = {Gal Yona and Amirata Ghorbani and James Zou},
  journal= {arXiv preprint arXiv:1910.04214},
  year   = {2021}
}

备注

To appear in AAAI/ACM Conference on AI, Ethics, and Society (2021)