推理微调重新定位基模型中的潜在表示
机器学习
2025-07-18 v1
摘要
回溯作为由推理微调激发的现象,已被证明是推理模型增强能力的关键机制。先前的工作通过驾驭向量成功地操纵了这一行为,但其 underlying 机制仍鲜有了解。在本工作中,我们展示了 DeepSeek-R1-Distill-Llama-8B 中的回溯在一定程度上是由基模型激活中已存在的重新定位方向驱动的。具体而言,我们识别出 base Llama-3.1-8B 残差流中的一个方向,当用于驾驭蒸馏推理模型时,系统性地诱导回溯,并且发现该方向的效果不能简单地用 token 级别属性解释。我们进一步发现,该方向在基模型中并不会诱导回溯,这表明推理微调过程重新定位了既存的表示以形成新的行为电路。此外,我们假设该方向是多个可能协同工作的方向之一,用于调节回溯。我们的发现为推理微调模型重新定位基模型既存表示,而非从头学习新能力提供了引人注目的图景。
引用
@article{arxiv.2507.12638,
title = {Reasoning-Finetuning Repurposes Latent Representations in Base Models},
author = {Jake Ward and Chuqiao Lin and Constantin Venhoff and Neel Nanda},
journal= {arXiv preprint arXiv:2507.12638},
year = {2025}
}
备注
6 pages, 6 figures. ICML 2025 Workshop on Actionable Interpretability