微调增强现有机制:实体追踪案例研究
计算与语言
2024-02-23 v1 机器学习
摘要
在指令遵循、代码生成和数学等广义任务上进行微调已被证明能提升语言模型在一系列任务上的表现。然而,关于此类微调如何影响这些模型内部计算的解释仍然模糊不清。我们研究了微调如何影响语言模型中实现的内部机制。作为案例研究,我们探讨了实体追踪这一语言理解的关键方面,在该方面,经过数学微调的模型表现出显著的性能提升。我们识别了实现实体追踪的机制,并表明:(i) 在原始模型及其微调版本中,主要是同一个电路实现实体追踪。事实上,原始模型的实体追踪电路在微调版本上的表现优于完整的原始模型。(ii) 所有模型的电路大致实现相同的功能:实体追踪是通过在原始模型及其微调版本中追踪正确实体的位置来执行的。(iii) 微调模型的性能提升主要归因于其处理增强位置信息能力的提高。为了揭示这些发现,我们采用了:Patch Patching、DCM(一种自动检测负责特定语义的模型组件的方法)以及 CMAP(一种跨模型修补激活以揭示改进机制的新方法)。我们的发现表明,微调增强而非根本性地改变了模型的机制操作。
引用
@article{arxiv.2402.14811,
title = {Fine-Tuning Enhances Existing Mechanisms: A Case Study on Entity Tracking},
author = {Nikhil Prakash and Tamar Rott Shaham and Tal Haklay and Yonatan Belinkov and David Bau},
journal= {arXiv preprint arXiv:2402.14811},
year = {2024}
}
备注
ICLR 2024. 26 pages, 13 figures. Code and data at https://finetuning.baulab.info/