语言模型组合泛化与幻觉中的线性相关性
计算与语言
2025-02-10 v1
摘要
语言模型(LM)的泛化能力正经历着激烈的争论,人们将其在通用智能方面的潜力与其在基础知识组合上的困难(例如,反向/过渡诅咒)进行了对比。本文揭示了LM在知识组合过程中存在线性相关现象。作为解释,在某些相关知识之间存在一个线性变换,可以将下一个token预测的logits从一个提示映射到另一个提示,例如,对于每个给定的X,将“X lives in the city of”映射为“X lives in the country of”。这反映了人类知识组合中的线性特征,如Paris France。我们的发现表明,这种线性变换对大规模微调具有鲁棒性,当其与现实世界关系对齐时能够泛化更新后的知识,但当其偏离时则会导致幻觉。实验结果表明,线性相关性可以作为LM泛化能力的潜在标识符。最后,我们表明这种线性相关性可以通过单个前馈网络和预训练词表表示来学习,这表明LM的泛化严重依赖于后者。
引用
@article{arxiv.2502.04520,
title = {Linear Correlation in LM's Compositional Generalization and Hallucination},
author = {Letian Peng and Chenyang An and Shibo Hao and Chengyu Dong and Jingbo Shang},
journal= {arXiv preprint arXiv:2502.04520},
year = {2025}
}