迈向可解释的序列续写:大语言模型中共享电路的分析
计算与语言
2024-10-08 v6 人工智能
机器学习
摘要
尽管 transformer 模型在语言任务上展现出强大能力,其复杂架构却难以解释。近期工作致力于将 transformer 模型逆向工程为人类可读的表示,称为实现算法功能的电路。我们扩展该研究,通过分析并比较相似序列续写任务(包括阿拉伯数字、数字单词与月份的递增序列)的电路。借助电路可解释性分析,我们在 GPT-2 Small 与 Llama-2-7B 中识别出负责检测序列成员并预测下一成员的关键子电路。我们的分析揭示语义相关序列依赖于具有类似角色的共享电路子图。此外,我们表明该子电路对各类数学相关提示产生影响,例如间隔电路、西班牙语数字单词与月份续写,以及自然语言应用题。总体而言,记录共享计算结构有助于更好的模型行为预测、错误识别与更安全的编辑流程。这种对 transformer 的机制性理解是构建更鲁棒、对齐且可解释语言模型的关键一步。
引用
@article{arxiv.2311.04131,
title = {Towards Interpretable Sequence Continuation: Analyzing Shared Circuits in Large Language Models},
author = {Michael Lan and Philip Torr and Fazl Barez},
journal= {arXiv preprint arXiv:2311.04131},
year = {2024}
}