基于方向导数对预测影响的零样本忠实文本解释
计算机视觉与模式识别
2026-05-19 v1
摘要
零样本文本解释旨在通过探测其内部表示来使图像分类器更透明,而无需依赖 task-specific supervision 或 LVLMs。然而,现有方法常常忽略真正驱动预测的特征,导致对 evidence 的忠诚度有限。为此,我们提出了 FaithTrace。我们认为,忠实的解释应描述强烈影响预测的概念,FaithTrace 直接度量由 explanation 诱导的表示如何改变 class logit。我们引入一个 influence score,计算 class logit 在 classifier feature space 中由 text-induced direction 上的方向导数,并用其作为忠诚度的 proxy。此外,我们将该 influence score 扩展为量化评估 metric,帮助填补文本解释忠诚度评估的空白。实验表明,FaithTrace 比基线方法生成更忠实的解释,促进了对模型进行更准确的理解。代码将公开发布。
引用
@article{arxiv.2605.16877,
title = {Zero-Shot Faithful Textual Explanations via Directional-Derivative Influence on Predictions},
author = {Toshinori Yamauchi and Hiroshi Kera and Kazuhiko Kawamoto},
journal= {arXiv preprint arXiv:2605.16877},
year = {2026}
}
备注
11+8 pages, 8 figures, 6 tables