简单机制性解释:超出上下文的推理
计算与语言
2025-07-17 v2 机器学习
摘要
超出上下文推理(Out-of-context reasoning,OOCR)是一种现象,即在微调的大语言模型展现出惊人的超分布式泛化能力。相较于学习浅层启发式方法,这些模型在隐式地内化并运用于微调数据中散布的观察结果的后果方面具有深刻的理解。在本工作中,我们从机制性角度探讨了这一现象,发现许多文献中关于OOCR的实例都有简单解释:LoRA微调本质上是添加一个常数引导向量,将模型引向某一一般概念。这一改进既提升了微调任务的性能,也在许多与该概念相关的领域中表现出色,导致了惊人的泛化。此外,我们可以从零开始直接训练这些任务的引导向量,这也会诱导OOCR。我们发现,即使是看似必须涉及条件行为的任务(模型后门),无条件添加引导向量也足以实现。总体而言,本工作提供了一种对OOCR任务在微调期间学习内容的解释,旨在回答为何大语言模型能够进行超出上下文推理这一关键问题,具有高度相关性,这与其在安全可靠部署方面的先进能力密切相关。
引用
@article{arxiv.2507.08218,
title = {Simple Mechanistic Explanations for Out-Of-Context Reasoning},
author = {Atticus Wang and Joshua Engels and Oliver Clive-Griffin and Senthooran Rajamanoharan and Neel Nanda},
journal= {arXiv preprint arXiv:2507.08218},
year = {2025}
}
备注
ICML 2025 Workshop R2-FM