中文

基于泰勒展开的 TaylorPODA 方法:提高不透明模型的后置归因

机器学习 2025-08-06 v3 人工智能 机器学习

摘要

现有的后置模型中性方法主要通过对模型输出对输入特征进行局部归因来生成外部解释,然而它们往往缺乏对单个特征贡献进行明确且系统化框架的量化。建立在 Deng 等人 (2024) 引入的泰勒展开框架中,用于统一现有局部归因方法的基础上,我们提出了一套严格的后置假设——“精确性”、“联邦化”和“零差异”——以支配泰勒项特定的归因。围绕这些假设,我们引入 TaylorPODA(泰勒展开派生的重要性排序适应归因),该方法包含额外的“适应性”属性。这一属性使其能够与特定任务的目标相一致,尤其是在缺乏 ground-truth 解释的后置情境中。经验评估表明,TaylorPODA 在与基线方法的竞争中取得了一致的结果,提供具有原则性和可视化友好性的解释。本工作通过提供更强理论基础的解释,增强了不透明模型可信部署的能力。

关键词

引用

@article{arxiv.2507.10643,
  title  = {TaylorPODA: A Taylor Expansion-Based Method to Improve Post-Hoc Attributions for Opaque Models},
  author = {Yuchi Tang and Iñaki Esnaola and George Panoutsos},
  journal= {arXiv preprint arXiv:2507.10643},
  year   = {2025}
}

备注

18 pages, 4 figures. Submitted to AAAI 2026. Re-upload with amended manuscript