中文

DeepDecipher:访问与探究大语言模型中的神经元激活

机器学习 2023-11-30 v2

摘要

随着大语言模型(LLMs)能力的增强,对可解释且透明的工具的需求日益迫切。现有方法难以实现,且缺乏可用于分析模型内部的易用工具。为弥补这一差距,我们提出 DeepDecipher——一个用于探测 transformer 模型 MLP 层中神经元的 API 与接口。DeepDecipher 使先进的大语言模型可解释性技术的输出易于获取。该易用接口也使检视这些复杂模型更加直观。本文概述了 DeepDecipher 的设计与功能。我们展示了如何分析神经元、比较模型并洞察模型行为。例如,我们将 DeepDecipher 的功能与 Neuroscope 及 OpenAI 的 Neuron Explainer 等类似工具进行对比。DeepDecipher 实现了对 LLMs 的高效、可扩展分析。通过提供最先进的可解释性方法,DeepDecipher 使 LLMs 更加透明、可信且安全。研究人员、工程师与开发者可快速诊断问题、审计系统并推动该领域发展。

关键词

引用

@article{arxiv.2310.01870,
  title  = {DeepDecipher: Accessing and Investigating Neuron Activation in Large Language Models},
  author = {Albert Garde and Esben Kran and Fazl Barez},
  journal= {arXiv preprint arXiv:2310.01870},
  year   = {2023}
}

备注

5 pages (9 total), 1 figure, submitted to NeurIPS 2023 Workshop XAIA