中文

短路捷径:文本分类中捷径的机制性研究

机器学习 2025-05-12 v1 计算与语言

摘要

对虚假相关性(捷径)的依赖已被证明是语言模型许多成功背后的原因。先前的工作侧重于识别影响预测的输入元素。我们研究了捷径在模型决策机制内部的实际处理方式。我们使用电影评论中的演员姓名作为可控捷径,这些捷径对结果有已知影响。我们使用机制可解释性方法,识别出专注于捷径的特定注意力头。这些注意力头在处理完整输入之前就将模型导向某个标签,有效地做出绕过上下文分析的过早决策。基于这些发现,我们引入了基于注意力头的令牌归因 (HTA),它将中间决策追溯回输入令牌。我们表明,HTA 在检测大语言模型中的捷径方面是有效的,并通过选择性地停用与捷径相关的注意力头来实现有针对性的缓解。

关键词

引用

@article{arxiv.2505.06032,
  title  = {Short-circuiting Shortcuts: Mechanistic Investigation of Shortcuts in Text Classification},
  author = {Leon Eshuijs and Shihan Wang and Antske Fokkens},
  journal= {arXiv preprint arXiv:2505.06032},
  year   = {2025}
}