Transformer 语言模型中的注意力白象效应
计算与语言
2026-05-28 v1 人工智能
摘要
指令式抑制广泛用于防止语言模型生成禁止内容,但是否减少了内部表征,或仅抑制了表达,仍不明确。我们通过表征探针、注意力分析和行为语义泄漏实验,研究了多个 Transformer 模型中的此问题。我们发现,在抑制下,禁止概念仍高度可被恢复,注意力路由继续受其影响,并且尽管成功实现了词汇避免,仍会显著影响下游生成。这些效应在不同的池化策略、间接语义控制以及多个模型家族中均持续存在。我们的结果揭示了行为层面与表征层面之间的根本性差距。
引用
@article{arxiv.2605.28639,
title = {The Attentional White Bear Effect in Transformer Language Models},
author = {Rebecca Ramnauth and Brian Scassellati},
journal= {arXiv preprint arXiv:2605.28639},
year = {2026}
}
备注
Currently under review at EMNLP 2026