中文

通过激活修补剖析语言模型中基于人物化的推理

机器学习 2025-09-23 v2 人工智能 计算与语言

摘要

大型语言模型(LLMs)在采用多样化人物化方面表现出惊人的灵活性。本研究检视了分配人物化如何影响模型在客观任务上的推理。通过激活修补,我们首次探索了模型关键组件如何编码人物化信息。我们的发现表明,早期多层感知器(MLP)层不仅关注输入的句法结构,还处理其语义内容。这些层将人物化标记转换为更丰富的表示,然后由中间多头注意力(MHA)层用于塑造模型的输出。此外,我们识别出特定注意力头在种族和颜色相关身份上表现突出。

关键词

引用

@article{arxiv.2507.20936,
  title  = {Dissecting Persona-Driven Reasoning in Language Models via Activation Patching},
  author = {Ansh Poonia and Maeghal Jain},
  journal= {arXiv preprint arXiv:2507.20936},
  year   = {2025}
}

备注

EMNLP (Findings) 2025