LLM可遭遇“脑坏死”:关于Twitter/X的初步研究
计算与语言
2026-04-23 v2 人工智能
摘要
我们提出并检验了LLM脑坏死假说:持续暴露于垃圾网络文本会导致大语言模型(LLMs)出现持续性认知衰退。为揭示垃圾效应,我们在真实的Twitter/X语料库上设计了一项新型受控实验,通过两种正交的操作化方式构建垃圾数据集与逆向对照数据集:M1(基于互动程度)和M2(基于语义质量),在规模和训练操作上保持匹配。与对照组相比,对4个LLM在垃圾数据集上进行持续预训练会导致认知能力下降(Hedges' g>0.3),包括推理、长程理解、安全性以及“黑色性格”特征(如反社会、 narcissism)。垃圾与对照数据集的渐进混合也呈现剂量反应认知衰退:例如在M1下,当垃圾比例从0%提升至100%时,ARC-Challenge链式思考得分从72.1降至57.2,RULER-CWE从83.7降至52.3。错误分析揭示了几个关键见解:首先,我们识别出“思考跳过”是推理损伤的主要病灶:模型越来越倾向于截断或跳过推理链。其次,观察到部分但不完全的修复:规模化指令微调和清洁持续预训练能够改善受损的认知能力,但无法恢复基准水平,表明存在持久的表征漂移而非格式不匹配。最后,我们发现推文的流行度(一种非语义指标)比M1中的长度更能预测脑坏死效应。总体而言,结果从多角度提供了显著证据,表明数据层面的社会效应可能是持续预训练中LLM能力衰退的因果驱动因素,从而动机对部署中和演化中的LLM进行常规的“认知健康检查”。
引用
@article{arxiv.2510.13928,
title = {LLMs Can Get "Brain Rot": A Pilot Study on Twitter/X},
author = {Shuo Xing and Junyuan Hong and Yifan Wang and Runjin Chen and Zhenyu Zhang and Ananth Grama and Zhengzhong Tu and Zhangyang Wang},
journal= {arXiv preprint arXiv:2510.13928},
year = {2026}
}
备注
Updated experiments with corrected data