为何大语言模型会生成有害内容?
人工智能
2026-04-14 v1
摘要
大语言模型 (LLM) 已被证明会生成有害内容。然而,其产生此类行为的底层原因仍未得到充分探索。我们提出一种基于因果中介分析的方法,以识别导致有害生成的因果因素。该方法在模型层、模块(MLP 和注意力块)以及单个神经元上进行多粒度分析。针对最新 SOTA LLM 进行大规模实验表明,有害生成发生在模型的后期层,结果主要来自 MLP 模块而非注意力模块,与作为有害生成门控机制的神经元相关联。结果表明,模型的早期层用于对提示中有害性进行情境理解,然后通过模型传递以在后期层生成有害内容,以及通过 MLP 模块传递表示有害性的信号。该信号最终传递至模型的最后一层,具体为稀疏神经元集合,这些神经元接收该信号并决定是否生成有害内容。
引用
@article{arxiv.2604.11663,
title = {Why Do Large Language Models Generate Harmful Content?},
author = {Rajesh Ganguli and Raha Moraffah},
journal= {arXiv preprint arXiv:2604.11663},
year = {2026}
}