自回归语言模型中的逆序不变性
计算与语言
2025-11-04 v1
摘要
我们形式化地定义了因果(自回归)语言建模(CLM)目标的一个结构性质:逆序不变性。形式上,下一个标记预测损失对语料库及其逆序赋予相同的似然度,这意味着标准 CLM 预训练是无方向感的。这种对称性解释了为何在逆序文本上训练的模型能够达到与在正向文本上训练的模型相当的性能,尽管人类语言和推理具有内在的时间非对称性。我们认为,这种不变性代表了当前预训练目标的一个局限,而非良性副作用。如果自然语言编码了方向性依赖——语音、形态学或因果——则对称的目标可能无法捕获这些依赖。因此,我们提出将预训练视为时间非对称性的视角,激励未来的工作开发明确建模语言箭头方向的损失函数和架构,同时保持标准语言建模能力。
引用
@article{arxiv.2511.00341,
title = {Reversal Invariance in Autoregressive Language Models},
author = {Mihir Sahasrabudhe},
journal= {arXiv preprint arXiv:2511.00341},
year = {2025}
}
备注
7 pages, theoretical note