中文

基于编码器的语言模型中 authorship 信号从何处涌现?

计算与语言 2026-05-27 v2

摘要

使用相同的预训练编码器、数据和损失函数微调的 authorship attribution 模型,仅因其评分机制的不同,性能就可能相差四倍。我们使用机制可解释性工具来解释这一差距。在我们探测的每个模型中,包括一个现成的控制编码器,风格特征(如词长、标点密度和功能词频率)在每一层都同样可用,这表明这种差距不能由它们的线性可读性来解释。相反,因果干预表明,评分器似乎决定了编码器在何处整合 authorship 信号。平均池化迫使在早期到中间层进行整合,而后期交互则将其推迟到更深的层。我们进一步从每个评分器的梯度结构中推导出这种差异,并且训练动力学揭示了源于该差异的独特学习轨迹。

关键词

引用

@article{arxiv.2605.19908,
  title  = {Where Does Authorship Signal Emerge in Encoder-Based Language Models?},
  author = {Francis Kulumba and Guillaume Vimont and Laurent Romary and Florian Cafiero},
  journal= {arXiv preprint arXiv:2605.19908},
  year   = {2026}
}

备注

12 pages, 6 figures. Under review