超越学习:模型适应的无训练替代方案
计算与语言
2026-02-19 v1 人工智能
摘要
尽管语言模型的持续研究和演进,但它们有时会低于 previous 版本。现有方法克服这些挑战需要大量资源,凸显了需要能够立即行动的替代方案。我们假设每个语言模型内部都有一个适合特定功能的局部模块。首先,本工作通过激活分析识别出一组在推理工作负载下表现出一致且局部激活变化的模块。随后,我们将针对特定任务而适当激活的内部模块移植到目标模型中,从而在无需额外训练或微调的情况下实现即时可测量的功能变化。为实验证明移植技术的有效性,我们量化了在不同条件下移植强度与性能改进之间的关系,针对两种语言模型进行分析。在 cross-generation 设置中,我们发现移植激活选定的模块可显著改善表现不佳的模型,最高可达目标基线的两倍,实现基于 gap 的恢复可达 100%。此外,在 base 模型与其 instruction-tuned 对应模型之间的移植实验中,移植使表现不佳的模型趋向于更强的基线,最高可达目标基线的约 2.33 倍,基于 gap 的恢复在最佳情况下可达 100%。这些结果表明,通过语言模型所暗示的高度局部化模块的植入可以实现有意义的容量转移。总体而言,本工作为语言模型中的任务局部分析提供了实证依据,并提出了新的研究领域:模型移植。
引用
@article{arxiv.2602.16189,
title = {Beyond Learning: A Training-Free Alternative to Model Adaptation},
author = {Namkyung Yoon and Kyeonghyun Yoo and Wooyong Jung and Sanghong Kim and Hwangnam Kim},
journal= {arXiv preprint arXiv:2602.16189},
year = {2026}
}
备注
7 pages, 3 figures, 5 tables. Preprint submitted to Pattern Recognition Letters