中文

EXAGREE:通过与利益相关者对齐的模型缓解解释不一致

机器学习 2025-11-18 v2 计算机与社会 机器学习

摘要

来自不同归因方法或模型内部的冲突解释限制了机器学习模型在安全关键领域的应用。我们将这种不一致转化为优势,并提出了 EXplanation AGREEment(EXAGREE),这是一个两阶段框架,可从一组表现相似的模型中选择与利益相关者对齐的解释模型(Stakeholder-Aligned Explanation Model, SAEM)。该选择最大化利益相关者-机器一致性(Stakeholder-Machine Agreement, SMA),这是一个统一了忠实性(faithfulness)和合理性(plausibility)的单一指标。EXAGREE 将基于可微分掩码的归因网络(differentiable mask-based attribution network, DMAN)与单调可微分排序相结合,使得在约束模型空间内进行基于梯度的搜索成为可能。在六个真实数据集上的实验展示了相对于基线在忠实性、合理性和公平性方面的同时提升,同时保持了任务准确率。广泛的消融研究、显著性检验和案例研究证实了该方法在实际中的鲁棒性和可行性。

关键词

引用

@article{arxiv.2411.01956,
  title  = {EXAGREE: Mitigating Explanation Disagreement with Stakeholder-Aligned Models},
  author = {Sichao Li and Tommy Liu and Quanling Deng and Amanda S. Barnard},
  journal= {arXiv preprint arXiv:2411.01956},
  year   = {2025}
}