函数诱导与任务泛化:基于离差加法的可解释性研究
计算与语言
2026-03-05 v3 人工智能
机器学习
摘要
大型语言模型展示出执行看似未知任务的引人注目的能力,通过通过情境学习。然而,仍不清楚模型内部哪些机制驱动了这种任务层次的泛化。在本工作中,我们从离差加法(即 1+1=3,2+2=5,3+3=?)的角度切入,这是一种两步、带有意外 +1 功能的反事实任务。利用诸如路径修补等电路风格可解释性技术,我们分析了模型在其性能背后的内部计算,并present了三个关键发现。首先,我们识别了一种解释模型从标准加法推导到离差加法的机制。它类似于先前工作中描述的归纳头机制,却 operates at 更高的抽象层次;因此,我们在本工作中将其称为“函数诱导”。其次,我们展示了 +1 功能的诱导是由多个注意力头并行发挥作用的,每一个发出 +1 功能的不同片段。最后,我们发现,这种函数诱导机制在更广泛的任务中被重用,包括合成任务如偏移多选 QA 以及算法任务如八进制加法。总体而言,我们的发现为洞察大型语言模型中可重用且可组合的结构如何启用任务层次泛化提供了更深入的见解。
引用
@article{arxiv.2507.09875,
title = {Function Induction and Task Generalization: An Interpretability Study with Off-by-One Addition},
author = {Qinyuan Ye and Robin Jia and Xiang Ren},
journal= {arXiv preprint arXiv:2507.09875},
year = {2026}
}
备注
ICLR 2026. Code: https://github.com/INK-USC/function-induction