中文

评估 LLM 理由的人类对齐性和模型忠诚性

计算与语言 2024-10-23 v2 人工智能

摘要

我们研究了大型语言模型(LLM)如何通过从输入文本中提取的令牌集合来解释其生成的决策过程。具体而言,我们系统性地研究了两种方法派生的理由:(1) 基于提示的流行方法,其中使用提示来指导LLM生成理由;(2) 技术归因方法,这些方法利用注意力或梯度来识别重要令牌。我们的分析涵盖三个带有标注理由的分类数据集,涵盖不同性能水平的任务。虽然基于提示的自我解释在广泛使用,但我们发现这些解释在"对齐"方面并不总是如人类理由那样。更重要的是,fine-tuning LLM 以提高分类任务准确率并不提高基于提示的理由的对齐程度。然而,它确实显著提高了归因方法(如InputXGradient)的对齐程度。更重要的是,我们表明基于提示的自我解释也不如归因方法"忠实",未能提供可靠的模型决策过程描述。为评估忠诚性,不同于以往研究排除了误分类实例,我们评估了所有实例并检查了fine-tuning 和准确率对对齐和忠诚性的影响。我们的发现表明,早期研究中报告的不可确定的忠诚性结果可能源于低分类准确率。这凸显了对 LLM 理由进行更严格和全面评估的重要性。

关键词

引用

@article{arxiv.2407.00219,
  title  = {Evaluating Human Alignment and Model Faithfulness of LLM Rationale},
  author = {Mohsen Fayyaz and Fan Yin and Jiao Sun and Nanyun Peng},
  journal= {arXiv preprint arXiv:2407.00219},
  year   = {2024}
}