层级与线性语法在大型语言模型中的 disjoint 处理机制
计算与语言
2025-01-16 v1 人工智能
摘要
所有自然语言都具有层级结构。在人类大脑中,这种结构限制被神经学地编码:当两种语法使用的词汇相同时,负责语言处理的脑区仅对层级语法敏感。使用大型语言模型(LLMs),我们研究是否存在仅仅由于暴露于大规模语言分布即可产生的功能上具有差异的层级处理区域。我们生成输入,采用英语、意大利语、日语或虚构词汇,使语法符合或层级规则或线性/位置规则。使用这些语法,我们首先观察到语言模型在层级结构输入与线性结构输入上的行为存在差异。随后,我们发现负责处理层级语法的组件与处理线性语法的组件是不同的;我们通过消融实验进行因果验证。最后,我们观察到层级选择性组件也在虚构语法上活跃,这表明层级敏感性并非与意义相关,也与分布外输入无关。
引用
@article{arxiv.2501.08618,
title = {Disjoint Processing Mechanisms of Hierarchical and Linear Grammars in Large Language Models},
author = {Aruna Sankaranarayanan and Dylan Hadfield-Menell and Aaron Mueller},
journal= {arXiv preprint arXiv:2501.08618},
year = {2025}
}