中文

归因解释的向后兼容性及增强模型训练方法

机器学习 2024-08-06 v1

摘要

模型更新是 ML/AI 系统运行中的关键过程。虽然模型更新通常会提升平均预测性能,但也显著影响预测的解释。在实际应用中,即使对解释进行微小的变更也可能产生不利后果。为解决此问题,本文引入 BCX—a 一种评估特征归因解释在更新前后模型之间向后兼容性的定量指标。BCX 利用实际一致性指标计算在两模型准确预测的样本上解释的平均一致性。此外,我们提出 BCXR—a 一种 BCX 感知的模型训练方法,通过设计准函数来理论降低一致性得分。进一步,我们提出 BCXR 的通用变体,通过利用模型解释之间的 L2 距离来提高所有一致性指标。为验证我们的方法,我们在八个真实数据集上进行实验,表明 BCXR 在预测性能和 BCX 得分之间实现了优越的权衡,展示了 BCXR 方法的有效性。

关键词

引用

@article{arxiv.2408.02298,
  title  = {Backward Compatibility in Attributive Explanation and Enhanced Model Training Method},
  author = {Ryuta Matsuno},
  journal= {arXiv preprint arXiv:2408.02298},
  year   = {2024}
}