中文

电路分析可解释性能否扩展?来自 Chinchilla 多选能力的证据

机器学习 2023-07-25 v3

摘要

电路分析是一种有望理解语言模型内部机制的技术。然而,现有分析均在远离最先进水平的小模型中进行。为此,我们提出了70B Chinchilla模型中的电路分析案例研究,旨在检验电路分析的可扩展性。具体地,我们研究多选问答,并考察Chinchilla在已知正确答案文本的情况下识别正确答案标签的能力。我们发现,现有的对数归因、注意力模式可视化和激活修补技术可自然扩展到Chinchilla,使我们能够识别并归类一小部分“输出节点”(注意力头和MLP)。我们进一步研究“正确字母”类注意力头,旨在理解其特征的语义,结果喜忧参半。对于正常多选问答答案,我们在处理多选问题答案标签时显著压缩了该头的查询、键和值子空间且无性能损失,并表明查询和键子空间至少在某种程度上表示了“枚举中的第N项”特征。然而,当我们试图用此解释来理解这些头在包含随机化答案标签的更一般分布上的行为时,发现它仅是部分解释,表明关于“正确字母”头在多选问答上运作机制仍有更多有待学习之处。

关键词

引用

@article{arxiv.2307.09458,
  title  = {Does Circuit Analysis Interpretability Scale? Evidence from Multiple Choice Capabilities in Chinchilla},
  author = {Tom Lieberum and Matthew Rahtz and János Kramár and Neel Nanda and Geoffrey Irving and Rohin Shah and Vladimir Mikulik},
  journal= {arXiv preprint arXiv:2307.09458},
  year   = {2023}
}