中文

从特征视角理解大型语言模型中的重复诅咒

计算与语言 2025-10-13 v3

摘要

大型语言模型(LLMs)在各个领域取得了显著进展,但常常出现重复文本生成,我们将其称为"重复诅咒"。虽然之前的研究提出了解码策略来缓解重复问题,但背后的机制仍未得到充分探索。在本工作中,我们通过机制可解释性的视角来探索LLMs中重复的根本原因。受稀疏自编码器(SAEs)的最新进展启发,这些方法实现了单语义特征提取,我们提出了一种新方法"Duplicatus Charm"来诱导和分析重复诅咒。我们系统性地识别"重复特征"——负责生成重复输出的关键模型激活。首先,我们通过logit分析定位参与重复的最相关层。接着,我们使用基于SAE的激活操控提取和激活相关特征。为了验证我们的方法,我们构建了一个覆盖标记和段落级别重复的重复数据集,并引入一个评估管道来量化所识别重复特征的影响。此外,通过去活化这些特征,我们有效地缓解了重复诅咒。我们工作的源代码已公开:https://github.com/kaustpradalab/repeat-curse-llm

关键词

引用

@article{arxiv.2504.14218,
  title  = {Understanding the Repeat Curse in Large Language Models from a Feature Perspective},
  author = {Junchi Yao and Shu Yang and Jianhua Xu and Lijie Hu and Mengdi Li and Di Wang},
  journal= {arXiv preprint arXiv:2504.14218},
  year   = {2025}
}

备注

Accepted by ACL 2025, Findings, Long Paper