LaCy:小型语言模型能学且应学的不仅是损失问题
计算与语言
2026-05-18 v3
摘要
语言模型不断增长以将更多世界知识压缩到其参数中,但可以预训练到其中的知识受其参数大小的上限限制。特别是小型语言模型 (SLM) 的能力有限,导致生成事实不正确的文本。这个问题通常通过让SLM访问外部源来缓解:查询更大模型、文档或数据库的能力。在此设置下,我们研究了一个基本问题:在预训练期间,SLM *能学且应学*哪些token,以及哪些token应通过`<CALL>` token *委托*。我们发现这不仅仅是损失问题:尽管损失能预测预测的token是否与真实值不匹配,但不足以识别哪些预测实际上会导致事实或语义无效的延续。一些高损失token对应于预训练文档的*可接受*替代延续,因此不应触发`<CALL>`。这表明可学习性不能仅从损失来表征,还需要关于token在句子中角色的额外领域特定信号。在类似维基百科的领域中,我们证明用来自spaCy解析器的轻量级语法信息增强损失信号可显著改善委托决策。基于这一见解,我们提出了LaCy,一种新颖的预训练方法,结合损失与事实性信号来决定SLM应学习哪些token。我们的实验表明,LaCy模型成功学习了预测哪些token以及何时请求帮助。这导致在与更大模型级联生成时获得更高的事实分数,并优于Rho或LLM-judge训练的SLM,同时更简单且更便宜。
引用
@article{arxiv.2602.12005,
title = {LaCy: What Small Language Models Can and Should Learn is Not Just a Question of Loss},
author = {Szilvia Ujváry and Louis Béthune and Pierre Ablin and João Monteiro and Marco Cuturi and Michael Kirchhof},
journal= {arXiv preprint arXiv:2602.12005},
year = {2026}
}
备注
40 pages, 26 figures, 10 tables, preprint. v3: new results for RAG, ablations and additional analysis