面向可解释性的双目标优化:精准度与可解释性的对齐
机器学习
2026-05-08 v3 人工智能
摘要
本文引入解释性引导的双目标优化框架(Interpretability-Guided Bi-objective Optimization, IGBO),通过双目标公式将结构化领域知识纳入可解释模型训练中。IGBO 通过基于中心极大似然(Central Limit Theorem)的构建方法将特征重要性层次编码为有向无环图(Directed Acyclic Graph, DAG),并使用 Temporal Integrated Gradients(TIG)来衡量特征重要性。该框架采用一种新的相对重要性得分 来量化每个特征在时间上的归一化累积归因。我们提出了一种几何投影映射 用于组合任务梯度与可解释性梯度,并证明了收敛于 Pareto 次稳态点。为解决 TIG 计算中的分布外问题,我们概述了一种最优路径 oracle 架构,留待后续工作。基于中心极大似然的可解释性 DAG 构建提供了关于无环性和传递性的统计保证,其中对中位数阈值的无条件保证以及对更高置信水平的条件保证。
引用
@article{arxiv.2601.00655,
title = {Interpretability-Guided Bi-objective Optimization: Aligning Accuracy and Explainability},
author = {Kasra Fouladi and Hamta Rahmani},
journal= {arXiv preprint arXiv:2601.00655},
year = {2026}
}
备注
12 pages