谁该负责?联合量化学习算法与训练数据的贡献
机器学习
2021-05-04 v2 人工智能
机器学习
摘要
一个在数据集 上训练的学习算法 在测试时被发现对某个子群体表现不佳。责任应当归于何处?可以认为数据负有责任,例如,若在更具代表性的数据集 上训练 本可改善性能。但同样也可以认为 本身有过错,若在相同数据集 上训练一个不同的变体 本可改善性能。随着机器学习变得普及且此类失败案例更为常见,这类问题正被证明远非假想。受此驱动,本文对学习算法 与数据集 之间的联合信用分配问题给出了严格的形式化。我们提出 Extended Shapley 作为该问题的原则性框架,并通过实证实验探讨其如何用于应对机器学习问责问题。
引用
@article{arxiv.1910.04214,
title = {Who's responsible? Jointly quantifying the contribution of the learning algorithm and training data},
author = {Gal Yona and Amirata Ghorbani and James Zou},
journal= {arXiv preprint arXiv:1910.04214},
year = {2021}
}
备注
To appear in AAAI/ACM Conference on AI, Ethics, and Society (2021)