比较解释不够,需要解释变化:大语言模型行为转变的新标准
人工智能
2026-05-21 v2 机器学习
摘要
大规模基础模型在施加规模、微调、基于人类反馈的强化学习或情境学习等干预后表现出行为转变。当前的可解释性方法在结构上不适合解释这些转变,因为它们要么将模型视为静态对象,如传统的可解释AI(XAI)方法一样,要么仅在不同模型检查点之间比较独立的解释。结果,这些方法无法解释在某种行为随干预而转变的两个模型实例之间的功能性转换。这一差距在欧盟AI法案、美国州立法和中国AI法规等司法管辖区引发显著的治理风险,这些法规要求为重大系统修改建立因果链。本position论文认为,解释大语言模型中的行为转变需要一种原则方法,将转变本身作为解释的主要对象:即一种解释干预如何将参考模型转化为具有不同行为的更新模型的方法。为支持这一论点,我们引入比较XAI(XAI),这是一种新的XAI范式,旨在解释在行为发生转变的两个模型检查点之间的差异,同时提出了一组规定XAI解释器和解释必须满足的要求,包括可比性、有效性、可操作性和监控,目标是将模型审计建立在明确、可衡量的要求上。最后,我们通过说明性实验提供初步证据,表明XAI在实践中是必需的,并将所得结果编译成可直接用于治理和事件文档的转换报告。
引用
@article{arxiv.2602.02304,
title = {Comparing Explanations is Not Enough, Explain the Change: New Standards are Needed to Explain Behavioral Shifts in Large Language Models},
author = {Martino Ciaperoni and Marzio Di Vece and Roberto Pellungrini and Luca Pappalardo and Fosca Giannotti and Francesco Giannini},
journal= {arXiv preprint arXiv:2602.02304},
year = {2026}
}