因果性 ≠ 不变性:LLM中的功能向量与概念向量
计算与语言
2026-02-27 v1 机器学习
摘要
大型语言模型(LLM)是否以抽象方式表示概念,即独立于输入格式?我们重新审视功能向量(Function Vectors, FVs),这是一类紧凑的类间学习(in-context learning, ICL)任务表示,因而在任务性能中发挥因果作用。我们在多种LLM上展示,FVs并非完全不变:即使两个输入格式(如开放式与多选题)都针对同一概念,提取的FVs也几乎正交。这一发现揭示了FVs在不同输入格式下的表示差异性。我们识别了概念向量(Concept Vectors, CVs),它们携带更稳定的概念表示。与FVs类似,CVs由注意力头输出组成;但与FVs不同,CVs的构成注意力头是通过基于表示相似性分析(Representational Similarity Analysis, RSA)选择的,即选择那些在不同输入格式下编码概念一致的注意力头。虽然这些头在类似层次中出现,但与FV相关的头 largely distinct,表明其背后机制不同。通过操纵实验,我们发现FVs在分布内表现出色,即提取与应用格式匹配时(例如,均为英文开放式),而CVs则在跨分布的情形下表现更佳,包括问题类型(开放式与多选题)和语言之间。我们的研究表明,LLM确实包含抽象概念表示,但这些表示不同于驱动ICL性能的表示。
引用
@article{arxiv.2602.22424,
title = {Causality $\neq$ Invariance: Function and Concept Vectors in LLMs},
author = {Gustaw Opiełka and Hannes Rosenbusch and Claire E. Stevenson},
journal= {arXiv preprint arXiv:2602.22424},
year = {2026}
}