中文

大语言模型能否自我解释?一项关于 LLM 生成的自解释的研究

计算与语言 2023-10-18 v1 机器学习

摘要

诸如 ChatGPT 的大语言模型(LLMs)在多种自然语言处理(NLP)任务上展现出优越性能,包括情感分析、数学推理与摘要。此外,由于这些模型在人类对话上经指令微调以产生“有用”的回复,它们可以且常常会随回复一并产出解释,我们称之为自解释。例如,在分析影评情感时,模型可能不仅输出情感的正向性,还给出解释(如列出评论中带情感的词如“fantastic”和“memorable”)。这些自动生成的自解释质量如何?本文中,我们在情感分析任务上及特征归因解释这一可解释性文献中最常研究的设定之一(针对 ChatGPT 前模型)下探究此问题。具体而言,我们研究引发自解释的不同方式,在一组评估指标上评估其忠实度,并将其与传统解释方法如遮挡或 LIME 显著图比较。通过大量实验,我们发现 ChatGPT 的自解释与传统方法表现相当,但依据多种一致性指标与之颇为不同,同时生成成本低得多(因其随预测一并生成)。此外,我们识别出其若干有趣特性,促使我们重新思考 ChatGPT(类)LLM 时代的诸多当前模型可解释性实践。

关键词

引用

@article{arxiv.2310.11207,
  title  = {Can Large Language Models Explain Themselves? A Study of LLM-Generated Self-Explanations},
  author = {Shiyuan Huang and Siddarth Mamidanna and Shreedhar Jangam and Yilun Zhou and Leilani H. Gilpin},
  journal= {arXiv preprint arXiv:2310.11207},
  year   = {2023}
}