LLM 解释中的 Support-Contra 非对称性
计算与语言
2026-04-03 v2 人工智能
摘要
大型语言模型 (LLM) 越来越常在其预测结果中生成自然语言解释,但这些解释是否引用输入文本中用于预测的线索仍不明确。本文提出了一项关于 LLM 生成解释如何与文本分类任务中外部模型中预测词汇线索对齐的实证研究。为分析这种关系,我们将解释内容与来自透明线性分类器提取的可解释特征重要性信号进行比较。这些参考模型允许我们将预测词汇线索划分为相对于预测标签的支持性和矛盾性证据。我们在三个基准数据集上进行观察——WIKIONTOLOGY、AG NEWS 和 IMDB——发现一种持续的实证模式,我们称之为 support-contra 非对称性。伴随正确预测的解释倾向于引用更多支持性词汇线索和更少的矛盾性线索,而与错误预测相关的解释则引用了大量矛盾证据。这种模式在数据集之间、参考模型家族(逻辑回归和线性 SVM)以及多个特征检索深度上均表现出一致性。这些结果表明,LLM 的解释在预测正确时,往往反映出对任务有预测作用的词汇信号;而错误预测则更常与引用输入中误导性线索的解释相关联。我们的发现提供了一种简单实证的解释-证据对齐视角,说明如何利用外部预测证据来源来分析 LLM 生成解释的行为。
引用
@article{arxiv.2510.21884,
title = {Support-Contra Asymmetry in LLM Explanations},
author = {Avinash Patil},
journal= {arXiv preprint arXiv:2510.21884},
year = {2026}
}
备注
17 Pages, 12 Figures, 4 tables