语言再生成:信息局部性对重构影响的研究
计算与语言
2026-07-11 v1
摘要
信息局部性,即句法相关的词倾向于出现在一起,塑造了人类语言处理和语言模型学习。虽然先前的工作已经检验了语言模型是否能习得不可能语言,但它们是否能从这种输入中恢复自然语言以及这揭示了它们什么样的归纳偏置,仍不清楚。我们通过用基于可学习性的方法补充一个重构框架来解决这个问题:对在不可能语言上预训练的GPT-2模型进行微调,以从三种扰动类型中重构自然英语。我们的研究结果表明,恢复的结构表现出比原始文本更短的依存距离,反映了在无约束语言模型生成中观察到的局部性偏好,并提供了一种可学习的实验单独无法揭示的架构偏置的定量特征。恢复难度随着局部性破坏程度的增加而增加。结构恢复(依存三元组F1)与表面恢复(精确匹配)分离,而在全局打乱下,流畅性与忠实重构分离。句子长度进一步调节性能:当局部结构保留时,较长的句子有助于恢复,但在全局打乱下会导致完全崩溃。最后,恢复难度在不同扰动类型间追踪可学习性难度,表明信息局部性是同时支配两者的共同约束。
引用
@article{arxiv.2607.10268,
title = {Language Re-generation: An investigation into information locality effects on reconstruction},
author = {Amirhossein Mohammadi and Laurence E. Frank and Albert Gatt and Robert A. Bagheri},
journal= {arXiv preprint arXiv:2607.10268},
year = {2026}
}