中文

关于忠实性的积极论点:LLM自我解释有助于预测模型行为

人工智能 2026-02-04 v1 机器学习

摘要

大语言模型自我解释往往被作为AI监督的有前景工具,但其对模型真实推理过程的忠实性仍不为人所理解。现有的忠实性指标存在关键局限,通常依赖对抗性提示来识别不忠实性或检测推理错误,这些方法忽略了解释的预测价值。我们引入归一化可模拟性收益(NSG),这是一种通用且可扩展的指标,基于忠实解释应允许观察者学习模型决策准则,从而更好地预测其在相关输入上的行为。我们评估了18个前沿专有和开源权重模型(如Gemini 3、GPT-5.2和Claude 4.5),在覆盖健康、商业和伦理等流行数据集的7,000个反事实样本上进行测试。我们发现,自我解释在预测模型行为方面显著提升(11-37% NSG),自我解释还比由外部模型生成的解释提供更多预测信息,即使这些模型更强大。这表明来自自我知识的优势是外部解释方法无法复制的。我们的 метод也揭示了在模型之间,5-15%的自我解释严重误导。尽管其不完美,但我们展示了对自我解释的积极论点:它们编码的信息有助于预测模型行为。

关键词

引用

@article{arxiv.2602.02639,
  title  = {A Positive Case for Faithfulness: LLM Self-Explanations Help Predict Model Behavior},
  author = {Harry Mayne and Justin Singh Kang and Dewi Gould and Kannan Ramchandran and Adam Mahdi and Noah Y. Siegel},
  journal= {arXiv preprint arXiv:2602.02639},
  year   = {2026}
}