原型知识塑造大语言模型在下游任务中的行为:记忆与通用性与知识图谱
计算与语言
2025-05-22 v1 人工智能
摘要
我们提出了原型知识(protoknowledge)的概念,以形式化和度量大语言模型(LLMs)在预训练期间内化编码为知识图谱的 token 序列,并在推理时利用这种内化知识。事实上,LLMs 已显示出在预训练期间记忆海量 token 序列的能力,而核心开放问题是它们如何通过通用性将这种记忆作为可重用知识加以利用。我们将原型知识分为词汇型、层次型和拓扑型三种形式,差异在于需要激活的知识类型。我们通过知识激活任务(KATs)度量原型知识,分析其一般属性,如语义偏差。我们随后研究原型知识对文本到 SPARQL 性能的影响,通过变化提示策略来适应不同的输入条件。为此,我们采用一种新型分析框架,用于评估模型预测是否与为每个查询激活相关原型知识的成功相吻合。该方法提供了一个探索语义层面数据污染的实用工具,同时也是封闭预训练模型的有效策略。
引用
@article{arxiv.2505.15501,
title = {Protoknowledge Shapes Behaviour of LLMs in Downstream Tasks: Memorization and Generalization with Knowledge Graphs},
author = {Federico Ranaldi and Andrea Zugarini and Leonardo Ranaldi and Fabio Massimo Zanzotto},
journal= {arXiv preprint arXiv:2505.15501},
year = {2025}
}