量化真实鲁棒性:面向可信 XAI 评估的同义词加权相似度
机器学习
2025-12-30 v2 人工智能
计算与语言
摘要
对抗性攻击通过改变解释而保持模型输出不变,挑战了可解释人工智能(XAI)的可靠性。这些攻击在基于文本的 XAI 上的成功与否,通常使用标准信息检索指标来评判。我们认为,这些指标在评估可信度方面并不适用,因为它们将所有词扰动等同对待,而忽略了同义词关系,这可能会歪曲攻击的真实影响。为解决此问题,我们应用了同义词加权方法,该方法通过纳入扰动词的语义相似性来修正这些指标。这能产生更准确的漏洞评估,并为评估 AI 系统的鲁棒性提供重要工具。我们的方法防止了攻击成功率的过度估计,从而能更真实地理解 XAI 系统对抗对抗性操纵的实际韧性。
关键词
引用
@article{arxiv.2501.01516,
title = {Quantifying True Robustness: Synonymity-Weighted Similarity for Trustworthy XAI Evaluation},
author = {Christopher Burger},
journal= {arXiv preprint arXiv:2501.01516},
year = {2025}
}
备注
10 pages, 2 figures, 6 tables. Changes to title, abstract and minor edits to the content as a result of acceptance to the 59th Hawaii International Conference on System Sciences