论自然语言解释忠实度或自一致性之度量
计算与语言
2024-09-20 v4 人工智能
机器学习
摘要
大型语言模型(LLMs)可以通过事后解释或思维链(CoT)解释来阐明其预测。但LLM可能编造听起来合理却与其底层推理不忠实的解释。近期工作设计了旨在判断事后或CoT解释忠实度的测试。本文中我们主张,这些忠实度测试并未度量对模型内部运作的忠实性——而是度量其在输出层面的自一致性。我们的贡献有三方面:i)我们澄清了忠实度测试在模型可解释性中的地位,将其重新刻画为自一致性测试。为佐证这一评估,ii)我们构建了用于自一致性测试的对比一致性库(Comparative Consistency Bank),首次在由11个开放LLM和5项任务组成的通用套件上比较现有测试——其中包括iii)我们新的自一致性度量CC-SHAP。CC-SHAP是一种细粒度的(而非测试的)LLM自一致性度量,它比较模型输入对预测答案和生成解释的贡献。我们的细粒度CC-SHAP度量使我们能够iii)比较LLM做预测时的行为,并在更深层次上分析其他一致性测试的效果,这通过将我们带得比严格的表面输出导向测试更接近模型内部,使我们向度量忠实度迈进了一步。我们的代码见\url{https://github.com/Heidelberg-NLP/CC-SHAP}
引用
@article{arxiv.2311.07466,
title = {On Measuring Faithfulness or Self-consistency of Natural Language Explanations},
author = {Letitia Parcalabescu and Anette Frank},
journal= {arXiv preprint arXiv:2311.07466},
year = {2024}
}
备注
Paper accepted for publication at ACL 2024 Main (Bangkok, Thailand); 10 main paper pages, 30 appendix pages