语言模型中的形式与功能语言机制是否分离?
计算与语言
2025-08-29 v4
摘要
尽管大语言模型的能力日益增强,但这些能力的分布并不均衡:它们擅长形式语言任务,如生成流畅、符合语法的文本,但在推理和一致的事实检索等功能语言任务上则更为吃力。受神经科学启发,近期的研究表明,要想在形式和功能语言任务上都取得成功,LLMs 应该为两者使用不同的机制;这种局部化可能是内置的,也可能是通过训练自发产生的。在本文中,我们提出一个问题:随着功能语言能力快速提升,当前模型是否表现出形式和功能语言机制的明显局部化?我们通过寻找并比较负责各种形式和功能任务的“回路”(即最小计算子图)来回答这个问题。通过比较 5 个 LLMs 上的 10 个不同任务,我们发现,虽然形式任务和功能任务的回路之间确实几乎没有重叠,但形式语言任务之间也几乎没有重叠,这与人类大脑中的情况类似。因此,一个统一且独立于功能任务回路的单一形式语言网络仍然难以捉摸。然而,在跨任务忠实度(即一个回路解决另一个回路任务的能力)方面,我们观察到了形式和功能机制之间的分离,这表明形式任务之间可能存在共享机制。
引用
@article{arxiv.2503.11302,
title = {Are formal and functional linguistic mechanisms dissociated in language models?},
author = {Michael Hanna and Yonatan Belinkov and Sandro Pezzelle},
journal= {arXiv preprint arXiv:2503.11302},
year = {2025}
}
备注
To appear in Computational Linguistics. Pre-MIT Press publication version. 40 pages, 14 figures, 3 tables. Code available at https://github.com/hannamw/formal-functional-dissociation