为什么时间序列特征归因会出现类别依赖评估效应?一项合成数据研究
机器学习
2026-05-12 v2 人工智能
摘要
评估特征归因方法是可解释人工智能(XAI)中的一个关键挑战,因为研究人员通常在真实值不可用时依赖基于扰动的评估指标。然而,近期研究表明,这些评估指标在同一数据集的不同预测类别上可能表现出不同的性能。这些"类别依赖评估效应"引发了关于扰动分析是否可靠地衡量归因质量的问题,对 XAI 方法的开发和评估可信度具有直接影响。我们通过在真实特征位置已知的合成时间序列数据上进行受控实验,探究了这些类别依赖效应出现的条件。我们系统地变化了二元分类任务中的特征类型和类别对比,然后将基于扰动的退化分数与基于真实值的精确率-召回率指标在多种归因方法下进行了比较。我们的实验表明,类别依赖效应在两种评估方法下都会出现,即使在具有时间局部化特征的简单场景中也是如此,并且由类别之间特征幅度或时间跨度的基本变化所触发。最关键的是,我们发现基于扰动的指标和基于真实值的指标经常对不同类别的归因质量给出相互矛盾的评估,两种评估方法之间的相关性较弱。这些结果表明,研究人员应谨慎解读基于扰动的指标,因为它们可能并不总是与归因是否正确识别判别性特征一致。通过揭示这种脱节,我们的工作指出了重新思考归因评估实际衡量了什么的方向,以及开发能够捕捉归因质量多个维度的更严格的评估方法。
引用
@article{arxiv.2506.11790,
title = {Why Do Class-Dependent Evaluation Effects Occur with Time Series Feature Attributions? A Synthetic Data Investigation},
author = {Gregor Baer and Isel Grau and Chao Zhang and Pieter Van Gorp},
journal= {arXiv preprint arXiv:2506.11790},
year = {2026}
}
备注
Accepted at TempXAI Workshop @ ECML-PKDD 2025 (Explainable AI for Time Series and Data Streams)