原子化文学风格:神经语言模型中文学生成的机制性操控
计算与语言
2025-10-22 v1
摘要
我们对GPT-2中文学风格的机制性分析进行了表述,识别出判别优秀散文与僵硬AI生成文本的单个神经元。以Herman Melville的《Bartleby, the Scrivener》为语料库,我们提取了来自32,768个后层神经元中3.55亿参数的激活模式。我们发现有27,122个统计显著判别性神经元(),其效应大小可达d。通过系统化的消融研究,我们发现了一个悖论性结果:尽管这些神经元在分析阶段与文学文本相关,但移除它们往往会改善而非降低生成文本的质量。具体而言,消融50个高判别性神经元可实现25.7%的文学风格指标提升。这表明神经网络中观察相关性与因果必然性之间存在关键鸿沟。我们的发现挑战了神经元在激活于理想输入时会产生这些输出的假设,其对机制可解释性研究和AI对齐具有深远影响。
引用
@article{arxiv.2510.17909,
title = {Atomic Literary Styling: Mechanistic Manipulation of Prose Generation in Neural Language Models},
author = {Tsogt-Ochir Enkhbayar},
journal= {arXiv preprint arXiv:2510.17909},
year = {2025}
}
备注
12 pages, 3 figures, 4 tables