上下文外溯因:大语言模型利用早期训练数据中的陈述性事实对过程性数据进行推理
计算与语言
2025-08-04 v1 人工智能
摘要
大型语言模型(LLM)在大型语料库上进行训练,但尚不清楚它们是否能对其训练数据中存在的信息进行推理。我们设计了实验来研究LLM的上下文外溯因能力,即利用训练数据中存在的相关事实推断出观察结果最合理解释的能力。我们在虚构聊天机器人的名称和行为描述上训练处理组LLM,但不训练与聊天机器人的对话示例。我们发现,OpenAI的GPT 4o LLM在观察到该聊天机器人特征性的回复示例后,能够正确推断出至少一个聊天机器人的名称。我们还发现,先前在聊天机器人行为描述上训练GPT 4o,使其在迭代训练以展示此类行为时,能够表现出更具该聊天机器人特征的行为。我们的结果对LLM中的情境感知具有启示意义,因此也对人工智能安全具有启示意义。
引用
@article{arxiv.2508.00741,
title = {Out-of-Context Abduction: LLMs Make Inferences About Procedural Data Leveraging Declarative Facts in Earlier Training Data},
author = {Sohaib Imran and Rob Lamb and Peter M. Atkinson},
journal= {arXiv preprint arXiv:2508.00741},
year = {2025}
}