语言模型中的标点与谓词
计算与语言
2025-08-21 v1 机器学习
摘要
本文探讨了信息在大型语言模型(LLM)中层间的收集方式与传播路径。我们首先检查了标点标记在模型中的计算重要性——此前已证实其作为注意力汇聚点和记忆辅助器。通过干预技术,我们评估了标点标记在GPT-2、DeepSeek和Gemma模型不同层中对模型性能保持的必要性与充分性。我们的结果显示出显著的模型差异:对于GPT-2,标点在多个层中既是必要的又是充分的,而在DeepSeek和Gemma中则适用性大幅降低。除标点外,我们进一步探询LLM是否通过形成早期静态摘要来处理输入的不同组成部分(如主语、形容词、标点、完整句子),这些摘要是否被网络中所有层复用;或者模型是否在各层保持对这些组成部分的敏感性。除标点外,我们还调查了不同推理规则的处理方式。特别是通过交互干预和层级置换实验,我们发现条件语句(if, then)和全称量化(for all)的处理方式差异显著。我们的发现为理解LLM中标点用法和推理机制提供了新视角,对模型可解释性具有重要意义。
引用
@article{arxiv.2508.14067,
title = {Punctuation and Predicates in Language Models},
author = {Sonakshi Chauhan and Maheep Chaudhary and Koby Choy and Samuel Nellessen and Nandi Schoots},
journal= {arXiv preprint arXiv:2508.14067},
year = {2025}
}