中文

提示微调对自动化神经元解释的重要性

计算与语言 2023-10-12 v2 机器学习

摘要

近期的进展极大提升了大语言模型(LLM)的能力,但我们对模型及其安全性的理解并未同步推进。本文旨在通过研究 LLM 的单个神经元来更深入地理解它们。我们建立在先前工作之上,该工作表明 GPT-4 等大型语言模型可有助于解释语言模型中每个神经元的功能。具体而言,我们分析了用于生成解释的提示的影响,并展示以更自然的方式重新格式化解释提示可显著提升神经元解释质量并大幅降低计算成本。我们通过三种不同方式展示了新提示的效果,结合了自动化与人工评估。

关键词

引用

@article{arxiv.2310.06200,
  title  = {The Importance of Prompt Tuning for Automated Neuron Explanations},
  author = {Justin Lee and Tuomas Oikarinen and Arjun Chatha and Keng-Chi Chang and Yilan Chen and Tsui-Wei Weng},
  journal= {arXiv preprint arXiv:2310.06200},
  year   = {2023}
}