Adapter 合并重新激活潜在推理轨迹:机制分析
计算与语言
2026-02-12 v4 人工智能
摘要
通过两阶段流水线(领域适应后接指令对齐)微调的大型语言模型在 Adapter 合并后可能表现出非平凡的干扰,包括在严格解码下显式推理轨迹的重新出现。我们在医疗 LLM 设置下使用轻量级、可复现的轨迹泄漏与指令遵循行为度量来研究这一现象。除了基于标记的代理指标外,我们引入了无标记、仅答案的评估,并定义了不依赖表面标记的基于正确性的方向;沿此方向的秩 1 logit 空间干预能够调节决策分布,并在足够大的干预强度下超越随机方向对照,提升多选题准确率。我们进一步提供了逐层几何证据,表明领域 Adapter 与指令 Adapter 引发了部分错位的更新方向,并提出了一个具备几何感知的合并概念验证,可在玩具设置中减少泄漏和/或提升准确率。我们的结果刻画了轨迹泄漏的边界条件,并为更安全的 Adapter 合并提供了实用的诊断与干预手段。
引用
@article{arxiv.2601.18350,
title = {Adapter Merging Reactivates Latent Reasoning Traces: A Mechanism Analysis},
author = {Junyi Zou},
journal= {arXiv preprint arXiv:2601.18350},
year = {2026}
}
备注
v4: Title/abstract updated. Adds robustness/controls (marker-forbidden answer-only evaluation; correctness-defined direction with random-direction control), layer-wise LoRA geometry analysis, and a toy geometry-aware merge baseline; improves clarity and reproducibility