语言模型是否知道该不说什么?关于统计性抢先的因果证据
计算与语言
2026-05-25 v1 人工智能
机器学习
摘要
学习者如何获得关于哪些内容不可接受的知识,而又没有负面证据?Construction Grammar(构造文法)提出统计性抢先机制:接触常规形式(例如“donated the books to the library”)会抢先于结构上可能但未被记录的备选方案("*donated the library the books")。本文提出了一种计算研究,首次在单一的一致设计中直接区分统计性抢先与竞争化咬合假设。我们展示了在120个英语动词-构造搭配(包括受动、因果、所为)上进行的四项实验,表明:(1) LLM的惊讶模式与人类可接受性判断高度相关(),并通过三个独立的行为数据集进行了验证;(2)这些模式由竞争形式频率驱动,而非整体动词频率,通过非循环偏相关得以确认;(3)抢先敏感性随模型规模呈幂律关系;(4)一种受控的微调干预因果地证明,操控竞争形式频率会按预期方向改变抢先行为,反向对照控制排除了频率敏感性的混淆因素。这些结果提供了关于神经语言模型如何通过分布式竞争获取负面语言知识的 convergent 证据,这是构造文法所主张的核心机制。
引用
@article{arxiv.2605.23039,
title = {Do Language Models Know What Not to Say? Causal Evidence for Statistical Preemption in LLMs},
author = {Dongxin Guo and Jikun Wu and Siu Ming Yiu},
journal= {arXiv preprint arXiv:2605.23039},
year = {2026}
}
备注
Accepted at CoNLL 2026. 21 pages (9 main body + appendices and references); 4 figures, 14 tables