中文

信赖可靠性:在寻找模型机制时超越电路重叠

机器学习 2024-07-16 v2 计算与语言

摘要

许多最近的语言模型(LM)可解释性研究都采用电路框架,该框架旨在找到解释LM在给定任务上行为的最小计算子图或电路。大多数研究通过对每条边独立进行因果干预来确定哪些边属于LM的电路,但这在模型规模扩大时效果不佳。边属性修补(EAP)——一种对干预的梯度近似方法——已作为一种可扩展但不完美的解决方案。本文引入了一种新方法——结合集成梯度的EAP(EAP-IG),旨在更好地保持电路的核心属性:可靠性。如果电路是可靠的,则电路之外的所有模型边都可以被剔除,而不会影响模型在该任务上的性能;可靠性正是研究电路的原因,而非完整模型。我们的实验表明,使用EAP找到的电路的可靠性低于使用EAP-IG找到的电路,尽管两者都与使用因果干预先前找到的电路具有高节点重叠度。我们得出结论,更一般地说,当使用电路来比较模型解决任务所采用的机制时,应该衡量的是可靠性,而非重叠度。

关键词

引用

@article{arxiv.2403.17806,
  title  = {Have Faith in Faithfulness: Going Beyond Circuit Overlap When Finding Model Mechanisms},
  author = {Michael Hanna and Sandro Pezzelle and Yonatan Belinkov},
  journal= {arXiv preprint arXiv:2403.17806},
  year   = {2024}
}

备注

COLM 2024