大型语言模型中类别与层次概念的几何结构
计算与语言
2025-02-19 v3 人工智能
机器学习
机器学习
摘要
线性表示假说是一种非正式观点,认为语义概念被编码为大型语言模型表示空间中的线性方向。先前的工作展示了如何使这一概念精确化,以表示具有自然对比的二元概念(例如{男性,女性})作为表示空间中的方向。然而,许多自然概念没有自然对比(例如,输出是否关于动物)。在这项工作中,我们展示了如何将线性表示假说的形式化扩展到将特征(例如,is_animal)表示为向量。这使我们能够立即将类别概念的形式化表示为表示空间中的多面体。此外,我们利用形式化证明了概念的层次结构与其表示几何之间的关系。我们在Gemma和LLaMA-3大型语言模型上验证了这些理论结果,使用WordNet数据估计了900多个层次相关概念的表示。
引用
@article{arxiv.2406.01506,
title = {The Geometry of Categorical and Hierarchical Concepts in Large Language Models},
author = {Kiho Park and Yo Joong Choe and Yibo Jiang and Victor Veitch},
journal= {arXiv preprint arXiv:2406.01506},
year = {2025}
}
备注
Accepted for an oral presentation at ICLR 2025. Best Paper Award at the ICML 2024 Workshop on Mechanistic Interpretability. Code is available at https://github.com/KihoPark/LLM_Categorical_Hierarchical_Representations