中文

自解释性:LLM 能描述驱动其决策的复杂内部过程

计算与语言 2025-11-12 v2

摘要

我们对大语言模型 (LLM) 如何以及为何以其所作方式作出反应了解有限。它们的神经网络已被证明难以解释,我们才刚开始梳理单个神经元和电路的功能。然而,另一条路径是调查和发展其自我解释能力的潜力。我们展示了 i) LLM 能准确描述其在特定决策过程中自身内部过程的定量特征,ii) 通过训练可以提高这些能力。为此,我们对 GPT-4o 和 GPT-4o-mini 进行微调,使其在广泛的复杂情境中做出决策(例如,在随机生成的、量化偏好下选择公寓、贷款、假期等),这些偏好规定了如何权衡不同属性(例如,公寓中自然光与安静环境的相对重要性)。我们证明了这些 LLM 能准确报告这些偏好(即,在决策过程中对不同属性赋予的权重)。随后,我们展示了这些 LLM 可以通过微调来更准确地解释其决策过程。最后,我们展示了这种训练具有广泛的推广性:它提高了模型准确解释其他复杂决策的能力,不仅限于其已微调的决策。这一工作是通向训练 LLM 准确、广泛报告其自身内部过程的一步——这将为可解释性、控制和安全性带来显著益处。

关键词

引用

@article{arxiv.2505.17120,
  title  = {Self-Interpretability: LLMs Can Describe Complex Internal Processes that Drive Their Decisions},
  author = {Dillon Plunkett and Adam Morris and Keerthi Reddy and Jorge Morales},
  journal= {arXiv preprint arXiv:2505.17120},
  year   = {2025}
}