大型语言模型的自解释是否忠实?
计算与语言
2024-05-20 v4 人工智能
机器学习
摘要
指令微调的大型语言模型(LLMs)在许多任务上表现出色,甚至能解释其推理过程,即所谓的自解释。然而,令人信服但错误的自解释可能导致对 LLMs 产生无根据的自信,从而增加风险。因此,衡量自解释是否真正反映了模型的行为至关重要。这种衡量标准称为解释忠实度(interpretability-faithfulness),由于无法获取真实标签(ground truth)且许多 LLMs 仅提供推理 API,因此极具挑战性。为解决这一问题,我们提出利用自一致性检查来衡量忠实度。例如,如果 LLM 声称一组单词对做出预测很重要,那么它在没有这些单词的情况下就不应能做出该预测。虽然自一致性检查是衡量忠实度的常用方法,但此前尚未成功应用于 LLM 自解释中的反事实、特征归因和删减解释。我们的结果表明,忠实度取决于解释类型、模型和任务,表明自解释通常不应被信任。例如,在情感分类任务中,反事实解释对 Llama2 更忠实,特征归因对 Mistral 更忠实,而删减解释对 Falcon 40B 更忠实。
引用
@article{arxiv.2401.07927,
title = {Are self-explanations from Large Language Models faithful?},
author = {Andreas Madsen and Sarath Chandar and Siva Reddy},
journal= {arXiv preprint arXiv:2401.07927},
year = {2024}
}
备注
The 62nd Annual Meeting of the Association for Computational Linguistics