大语言模型中关系解码线性算子结构
计算与语言
2025-10-31 v1 人工智能
机器学习
摘要
本文研究Hernandez 等人[2023]中引入的线性算子结构,这些算子用于解码变换语言模型中的特定关系事实。我们将其单关系发现扩展到一组关系,并系统性地绘制其组织结构。我们表明,这些关系解码器集合可以通过简单的三阶张量网络进行高度压缩,而不会显著损失解码精度。为解释这种意想不到的冗余性,我们开发了交叉评估协议,将每个线性解码算子应用于每其他关系的主语。我们的结果表明,这些线性映射并不编码独立的关系,而是提取重复的、粗粒度语义属性(例如,首都城市的国家和食物的国家都属于X的国家属性)。这种属性导向结构既解释了可压缩性,也说明了它们仅能泛化到语义上接近的新关系。我们的发现因此将变换语言模型中的线性关系解码解释为主要基于属性,而非关系特定。
引用
@article{arxiv.2510.26543,
title = {The Structure of Relation Decoding Linear Operators in Large Language Models},
author = {Miranda Anna Christ and Adrián Csiszárik and Gergely Becsó and Dániel Varga},
journal= {arXiv preprint arXiv:2510.26543},
year = {2025}
}
备注
NeurIPS 2025 (Spotlight)