真实场景下的算法补救:理解数据与模型偏移的影响
机器学习
2021-06-29 v3 人工智能
摘要
随着预测模型日益被部署以做出各种重大决策,人们越来越重视设计能够为受影响个体提供补救(recourse)的算法。现有的补救算法基于一个假设,即底层预测模型不发生变化。然而,在实践中模型会因包括数据分布偏移在内的多种原因而定期更新。在这项工作中,我们首次尝试理解由数据分布偏移引起的模型更新如何影响最先进算法生成的算法补救。我们进行了严格的理论与实证分析以解决上述问题。我们的理论结果建立了由于模型偏移导致补救失效概率的下界,并表明该失效概率与现代补救生成算法所最小化的典型“成本”概念之间存在权衡。我们使用多个合成与真实世界数据集进行实验,捕捉了不同类型的分布偏移,包括时间偏移、地理空间偏移以及由数据校正引起的偏移。这些实验表明,由上述所有分布偏移引起的模型更新都可能使最先进算法生成的补救失效。因此,我们的发现不仅暴露了当前补救生成范式中先前未知的缺陷,也为从根本上重新思考补救生成算法的设计与开发铺平了道路。
引用
@article{arxiv.2012.11788,
title = {Algorithmic Recourse in the Wild: Understanding the Impact of Data and Model Shifts},
author = {Kaivalya Rawal and Ece Kamar and Himabindu Lakkaraju},
journal= {arXiv preprint arXiv:2012.11788},
year = {2021}
}