中文

向量本体论:一种大语言模型世界观提取方法

人工智能 2025-06-17 v1 信息检索

摘要

大语言模型 (LLM) 拥有复杂的世界内部表征,但这些潜在结构往往难以解释或在原始预测任务之外重用。本文在 Rothenfusser (2025) 首次提出向量本体论将高维神经表征转化为可解释几何结构的框架基础上,提供了该方法的首个实证验证。向量本体论定义了由具有本体学意义维度张成的领域特定向量空间,允许对该领域内概念及其关系进行几何分析。我们构建了一个基于 Spotify 音频特征的 8 维音乐流派向量本体论,并测试了大语言模型对音乐世界模型能否被一致且准确地投射到该空间中。使用 GPT-4o-mini,我们通过多种自然语言提示提取流派表征,并分析这些投射在语言变体之间的一致性以及与真实数据分布的对齐程度。我们的结果表明:(1) 在 47 种查询公式下,流派投射具有高度的空间一致性;(2) LLM 推断的流派位置与真实世界音频特征分布之间存在强烈对齐;(3) 提示措辞与 LLM 推断向量本体论中的空间位移之间存在直接关系。这些发现表明 LLM 内部化了结构化、可重用的知识,向量本体论提供了一种透明且可验证的方法来提取和分析这种知识。

关键词

引用

@article{arxiv.2506.13252,
  title  = {Vector Ontologies as an LLM world view extraction method},
  author = {Kaspar Rothenfusser and Bekk Blando},
  journal= {arXiv preprint arXiv:2506.13252},
  year   = {2025}
}