中文

基于权重的语言模型去分词分析:无需推理即可理解推理的第一阶段

计算与语言 2025-02-11 v3

摘要

根据推理阶段假说,语言模型的早期层将其子词分词输入(该输入不一定对应语言学上有意义的切分)映射到更有意义的表征上,从而形成模型的“内部词汇表”。先前对去分词阶段的分析主要依赖于探针和路径修补等干预手段,这些方法需要选择特定输入、挑选待修补的组件,然后观察模型行为的变化。在此,我们证明去分词阶段的若干重要方面可以仅通过分析模型权重来理解,而无需执行任何模型推理步骤。具体而言,我们引入了GPT-2中第一层注意力的解析分解。该分解产生了可解释的项,用以量化位置相关、词元相关和混合效应的相对贡献。通过聚焦于这些分解项,我们发现了注意力偏向邻近词元以及去分词行为的基于权重的解释。

关键词

引用

@article{arxiv.2501.15754,
  title  = {Weight-based Analysis of Detokenization in Language Models: Understanding the First Stage of Inference Without Inference},
  author = {Go Kamoda and Benjamin Heinzerling and Tatsuro Inaba and Keito Kudo and Keisuke Sakaguchi and Kentaro Inui},
  journal= {arXiv preprint arXiv:2501.15754},
  year   = {2025}
}

备注

22 pages, 14 figures, to appear in NAACL Findings 2025