中文

Transformer 语言模型中的注意力白象效应

计算与语言 2026-05-28 v1 人工智能

摘要

指令式抑制广泛用于防止语言模型生成禁止内容,但是否减少了内部表征,或仅抑制了表达,仍不明确。我们通过表征探针、注意力分析和行为语义泄漏实验,研究了多个 Transformer 模型中的此问题。我们发现,在抑制下,禁止概念仍高度可被恢复,注意力路由继续受其影响,并且尽管成功实现了词汇避免,仍会显著影响下游生成。这些效应在不同的池化策略、间接语义控制以及多个模型家族中均持续存在。我们的结果揭示了行为层面与表征层面之间的根本性差距。

关键词

引用

@article{arxiv.2605.28639,
  title  = {The Attentional White Bear Effect in Transformer Language Models},
  author = {Rebecca Ramnauth and Brian Scassellati},
  journal= {arXiv preprint arXiv:2605.28639},
  year   = {2026}
}

备注

Currently under review at EMNLP 2026