中文

狭窄微调在激活差异中留下显而易见的可读取痕迹

计算与语言 2026-03-06 v3 人工智能

摘要

狭窄域微调已成为适应大型语言模型(LLM)以完成特定任务,或创建具有已知异常属性的模型以用于研究的 essential tool。我们展示,狭窄微调在LLM激活中制造了强烈的偏差,这些偏差可被解释以理解微调领域。这些偏差可通过模型diffing——即分析微调前后模型差异的简单工具发现。具体而言,分析前几项随机文本的激活差异,并通过添加该差异来操控模型激活,可产生类似微调数据格式与内容的文本。我们通过创建基于LLM的可解释性智能体来理解微调领域,证明这些分析包含关键信息。该智能体在获取偏差后,相较于仅使用简单提示的基准智能体表现显著更好。我们的分析覆盖合成文档微调(虚假事实、涌现误差、潜在学习、禁忌词猜游戏)模型,涉及不同架构(Gemma、LLaMA、Qwen)和规模(1B至32B参数)。我们认为这些偏差反映过拟合现象,发现将预训练数据混入微调语料库可大幅消除这些痕迹,尽管残余风险仍可能存在。我们的工作(1)证明狭窄微调的模型在激活中保留着其训练目标的显著痕迹,并指出改进训练方式的方法;(2)警示AI安全与可解释性研究者,使用此类模型作为研究更广泛微调(如聊天微调)的代理模型可能并不真实;(3)凸显对狭窄微调影响的深入调查需求,并为模型diffing、安全与可解释性研究发展真实案例提供指导。

关键词

引用

@article{arxiv.2510.13900,
  title  = {Narrow Finetuning Leaves Clearly Readable Traces in Activation Differences},
  author = {Julian Minder and Clément Dumas and Stewart Slocum and Helena Casademunt and Cameron Holmes and Robert West and Neel Nanda},
  journal= {arXiv preprint arXiv:2510.13900},
  year   = {2026}
}

备注

ICLR 2026