学习错误的教训:语法-域虚假关联在语言模型中的体现
计算与语言
2026-01-27 v3
摘要
要使 LLM 正确响应指令,必须理解给定任务-指令对的语义和域(即主题领域)。然而,语法也可能传递隐式信息。近期研究表明,语法模板——频繁出现的词性标注(PoS)序列序列——在训练数据中广泛存在且常出现在模型输出中。本文对语法模板、域和语义在任务-指令对中的情况进行表征。我们识别出语法-域之间的虚假关联,其中模型在训练期间学习将域与语法关联;这种关联有时会覆盖提示语义。使用合成训练数据集,我们发现语法-域关联可降低 OLMo-2 模型(1B-13B)在实体知识任务中的性能(平均 0.51 ± 0.06)。我们引入评估框架以检测训练模型中的此现象,表明其在开放模型(OLMo-2-7B;Llama-4-Maverick)和封闭模型(GPT-4o)的 FlanV2 数据集子集上均发生。最后,我们对安全微调的影响进行案例研究,表明意外的语法-域关联可被用于规避 OLMo-2-7B Instruct 和 GPT-4o 的拒绝机制。我们的发现凸显两项需求:(1)明确测试语法-域关联;(2)确保训练数据中特定领域内的语法多样性,以防止此类虚假关联。
引用
@article{arxiv.2509.21155,
title = {Learning the Wrong Lessons: Syntactic-Domain Spurious Correlations in Language Models},
author = {Chantal Shaib and Vinith M. Suriyakumar and Levent Sagun and Byron C. Wallace and Marzyeh Ghassemi},
journal= {arXiv preprint arXiv:2509.21155},
year = {2026}
}
备注
NeurIPS 2025 Spotlight