基于编码器的语言模型中 authorship 信号从何处涌现?
计算与语言
2026-05-27 v2
摘要
使用相同的预训练编码器、数据和损失函数微调的 authorship attribution 模型,仅因其评分机制的不同,性能就可能相差四倍。我们使用机制可解释性工具来解释这一差距。在我们探测的每个模型中,包括一个现成的控制编码器,风格特征(如词长、标点密度和功能词频率)在每一层都同样可用,这表明这种差距不能由它们的线性可读性来解释。相反,因果干预表明,评分器似乎决定了编码器在何处整合 authorship 信号。平均池化迫使在早期到中间层进行整合,而后期交互则将其推迟到更深的层。我们进一步从每个评分器的梯度结构中推导出这种差异,并且训练动力学揭示了源于该差异的独特学习轨迹。
引用
@article{arxiv.2605.19908,
title = {Where Does Authorship Signal Emerge in Encoder-Based Language Models?},
author = {Francis Kulumba and Guillaume Vimont and Laurent Romary and Florian Cafiero},
journal= {arXiv preprint arXiv:2605.19908},
year = {2026}
}
备注
12 pages, 6 figures. Under review