解释大语言模型中的重复 token 现象
机器学习
2025-03-13 v1 人工智能
计算与语言
密码学与安全
摘要
大语言模型尽管具有令人印象深刻的能力,但在被提示重复单个词时往往无法准确重复,而是输出不相关的文本。这种无法解释的失效模式代表了一种漏洞,甚至允许终端用户将模型引导偏离其预期行为。我们旨在解释这种现象的原因,并将其与“注意力汇”的概念联系起来,注意力汇是一种对流畅性至关重要的涌现 LLM 行为,其中初始 token 获得了不成比例的高注意力分数。我们的调查识别了负责注意力汇的神经回路,并展示了长时间重复如何破坏该回路。我们将这一发现扩展到表现出类似回路破坏的其他非重复序列。为了解决这个问题,我们提出了一种针对性的修补方案,能够有效解决该问题且不会对模型的整体性能产生负面影响。本研究为 LLM 漏洞提供了机制层面的解释,展示了可解释性如何诊断和解决问题,并为构建更安全、更可靠的模型提供了见解。
引用
@article{arxiv.2503.08908,
title = {Interpreting the Repeated Token Phenomenon in Large Language Models},
author = {Itay Yona and Ilia Shumailov and Jamie Hayes and Federico Barbero and Yossi Gandelsman},
journal= {arXiv preprint arXiv:2503.08908},
year = {2025}
}