中文

记忆、涌现与解释逆转失败:基于控制实验的LLM关系语义研究

计算与语言 2026-04-23 v2

摘要

自回归大语言模型(LLM)在需要通过关系词(如父亲/儿子、朋友)链接实体的关系任务中表现良好,但是否学习了此类关系的逻辑语义(如对称性和逆转逻辑),以及逆转型失败是否源于缺乏关系语义还是从左到右的顺序偏差,尚不明确。我们提出一种基于受控知识图谱的合成框架,生成包含对称/逆转三元组的文本,从头训练GPT系列自回归模型,并评估记忆、逻辑推理和对未见实体的零样本推理,以回答这些问题。我们发现,随着足够的逻辑语义监督,关系语义会出现尖锐的相位转变,即使在浅层(2-3层)模型中也会出现这种现象,并且成功的推理与中间层信号的稳定性相吻合。最后,通过顺序匹配的前向/后向测试和扩散基线,表明逆转失败主要由自回归顺序偏差所致,而非逆转语义不足。

关键词

引用

@article{arxiv.2601.02931,
  title  = {Memorization, Emergence, and Explaining Reversal Failures: A Controlled Study of Relational Semantics in LLMs},
  author = {Yihua Zhu and Qianying Liu and Jiaxin Wang and Fei Cheng and Chaoran Liu and Akiko Aizawa and Sadao Kurohashi and Hidetoshi Shimodaira},
  journal= {arXiv preprint arXiv:2601.02931},
  year   = {2026}
}

备注

ACL2026 Main Long Paper