模型为何失效?:将模型性能变化归因于分布偏移
机器学习
2023-06-07 v3 机器学习
摘要
机器学习模型在分布偏移下经常会出现性能下降。此类偏移的潜在原因可能是多个同时存在的因素,例如数据质量的变化、特定协变量分布的差异,或标签与特征之间关系的变化。当模型在部署期间确实失效时,将这些性能变化归因于这些因素,对于模型开发者识别根本原因并采取缓解措施至关重要。在这项工作中,我们引入了将不同环境之间的性能差异归因于底层数据生成机制中分布偏移的问题。我们将该问题表述为一个合作博弈,其中参与者为分布。我们将一组分布的价值定义为仅当这组分布在环境之间发生变化时模型性能的变化量,并推导出一种重要性加权方法用于计算任意分布集合的价值。随后,每个分布对总性能变化的贡献被量化为其 Shapley 值。我们在合成、半合成和真实世界的案例研究上展示了我们方法的正确性和实用性,表明其在将性能变化归因于广泛的分布偏移方面的有效性。
引用
@article{arxiv.2210.10769,
title = {"Why did the Model Fail?": Attributing Model Performance Changes to Distribution Shifts},
author = {Haoran Zhang and Harvineet Singh and Marzyeh Ghassemi and Shalmali Joshi},
journal= {arXiv preprint arXiv:2210.10769},
year = {2023}
}
备注
Published in ICML 2023