当可解释性分配不均时:混合可解释模型的公平性
机器学习
2026-05-28 v1
摘要
混合可解释模型通过将透明组件与黑箱模型组合,为某些示例分配可解释决策,剩余示例则交由后者处理。虽然这种设计使模型能够在准确性和可解释性之间实现灵活的权衡,但也引发了一种独特的程序公平性问题:某些人口统计学群体可能系统性地接收到可解释决策,而其他群体则被不成比例地路由到黑箱模型中。我们将此问题形式化为解释性覆盖不平等(Interpretability Coverage Disparity, ICD),这是一种应用于混合可解释模型路由决策的、类似人口公平性的度量标准。我们运用预测重复性(predictive multiplicity)的工具,研究了 ICD 在四种混合可解释学习方法、三个标准公平性基准数据集和多个敏感属性上的表现。我们的实验结果表明,在解释性和黑箱组件都被积极使用的中间透明度 regime 中,存在显著的 ICD。我们进一步表明,简单的数据覆盖不平等约束可在精确混合学习方法中显著降低 ICD,对准确性和稀疏性几乎没有影响。在许多情况下,ICD 的缓解措施也会改善标准算法公平性指标。这些结果表明,混合可解释模型不仅要审计其预测公平性,还要审计其如何在个体和群体之间分配可解释性。
引用
@article{arxiv.2605.28626,
title = {When Interpretability Is Unequally Distributed: Fairness in Hybrid Interpretable Models},
author = {Ziba Jabbar Zare and Ulrich Aïvodji and Julien Ferry and Thibaut Vidal},
journal= {arXiv preprint arXiv:2605.28626},
year = {2026}
}