IA2:基于 ICL 激活对齐改进监督微调
机器学习
2026-03-19 v3 人工智能
计算与语言
摘要
监督微调(Supervised Fine-Tuning, SFT)通过训练权重以针对查询产生预期的目标响应,来专门化模型行为。相比之下,上下文学习(In-Context Learning, ICL)在推理时利用提示中的指令或示例来适配模型。在数据稀缺的场景下,与 SFT 相比,ICL 能提供更好的泛化能力和更校准的响应,其代价是增加推理计算量。在本研究中,我们提出一个问题:ICL 的内部计算能否用于提升 SFT 的质量?我们首先表明,ICL 和 SFT 产生不同的激活模式,表明这两种方法通过不同的功能机制实现适配。受此观察启发,为了利用 ICL 的丰富功能,我们引入了 ICL 激活对齐(ICL Activation Alignment, IA2),这是一种自蒸馏技术,旨在 SFT 模型中复制 ICL 的激活模式,并激励类似 ICL 的内部推理。在 SFT 之前执行 IA2 作为预启动步骤,可显著提高模型输出的准确性和校准性,这已被我们在 12 个流行基准测试和两个模型族上的广泛实证结果所证明。这一发现不仅在实践中具有实用价值,也为理解模型适配的内部机制提供了一个概念窗口。
引用
@article{arxiv.2509.22621,
title = {IA2: Alignment with ICL Activations Improves Supervised Fine-Tuning},
author = {Aayush Mishra and Daniel Khashabi and Anqi Liu},
journal= {arXiv preprint arXiv:2509.22621},
year = {2026}
}
备注
International Conference on Learning Representations (ICLR) 2026