语言模型在形式语言能力上的异质性:数据是否是真正的瓶颈?
计算与语言
2026-04-21 v1 人工智能
机器学习
摘要
大型语言模型 (LLM) 在形式语言能力方面表现出令人 puzzles 的差异:虽然它们在某些语言现象上几乎达到完美掌握,但即便在训练了数万亿标记后,仍在其他现象上表现低于随机猜测。本文我们研究这些失败是源于固有的架构限制,还是仅因 web 规模语料中这些特定语法构造的稀缺。我们对 1000 万标记的 FineWeb 语料库进行随机抽样,对 GPT-2 Small (1.24 亿参数) 模型进行预训练,并通过注入针对特定语言现象的合成数据的少量 (1%) 来进行干预。我们发现,这种有针对性的干预在 8 个表现最差的 BLiMP 范式中显著提升模型性能——尤其是 specific paradigm only_npi_scope 的准确率从 20.9% 飙升至 69.4%。此外,我们观察到这些干预通常保持或略有提升整体性能。然而,我们也指出了一个顽固现象 principle_A_c_command,即使在数据增强后,其性能仍低于随机猜测。我们的发现虽然如此,仍为即使在小型语言模型中对模型通常表现较差的语言现象进行显著改进提供了乐观的存在论证。这表明,针对数据组成进行的努力可能为人类规模的语言建模带来巨大益处。我们的代码已开源于 https://github.com/kowndinya-renduchintala/heterogeneity-in-formal-linguistic-competence。
引用
@article{arxiv.2604.17930,
title = {Heterogeneity in Formal Linguistic Competence of Language Models: Is Data the Real Bottleneck?},
author = {H S V N S Kowndinya Renduchintala and Sumit Bhatia},
journal= {arXiv preprint arXiv:2604.17930},
year = {2026}
}
备注
ACL'26 (Findings)