通过双目标攻击揭示时间序列分类器解释的漏洞
机器学习
2026-02-10 v2
摘要
可解释的时间序列深度学习系统通常通过检查解释的时间一致性来评估,隐含将其视为鲁棒性证据。我们表明,这一假设可能失败:预测和解释可以被针对性误分类而解释仍然合理且与所选参考理由一致。我们提出 TSEF(Time Series Explanation Fooler),一种双目标攻击,联合操纵分类器和解释器输出。与单目标误分类攻击不同后者干扰解释并将归因质量广泛分布,TSEF 实现了针对性的预测更改,同时保持解释与参考一致。我们在多个数据集和解释器架构上进行实验,结果一致显示解释稳定性是决策鲁棒性的误导性代理,动机是建立受信赖的时间序列任务的耦合感知鲁棒性评估。
引用
@article{arxiv.2602.02763,
title = {Exposing Vulnerabilities in Explanation for Time Series Classifiers via Dual-Target Attacks},
author = {Bohan Wang and Zewen Liu and Lu Lin and Hui Liu and Li Xiong and Ming Jin and Wei Jin},
journal= {arXiv preprint arXiv:2602.02763},
year = {2026}
}