激活流形投影:从大语言模型架构中解放任务特定行为
人工智能
2026-04-15 v1
摘要
大型语言模型(LLM)架构的不断涌现提出了一个根本性挑战:通过低秩适应(LoRA)等微调方法学习到的有价值的、任务特定的行为实际上被困在其源模型架构内部,此被称为架构锁定。现有的迁移方法试图通过对齐模型的静态权重空间来弥合这一差距,这种方法脆弱且间接,依赖参数几何之间牦牦的相关性。本文引入一种根本不同且更直接的范式:Cartridge 激活空间迁移(CAST),一种新颖的框架,通过学习两个不同大语言模型架构之间激活流形(由模型内部神经元激活构成的几何结构)的直接、非线性映射来解放 LoRA 编码的行为。CAST 将预训练的 LoRA 视为冻结的“行为内核”。它学习一组轻量级、双向投影头,将目标模型的激活流译入源模型的潜在空间,应用冻结的内核,然后将结果投影回来。这一过程在无任何任务特定数据的情况下,针对通用文本语料库进行训练,有效地将所学技能从源架构中解耦。我们展示,CAST 使任何标准 LoRA 适配器都能实现“零样本”翻译。我们的实验,包括 Llama-2 和 Mistral 等异构模型族之间的迁移,表明 CAST 翻译的适配器在性能上达到源模型上完全重新训练 LoRA 的 85%-95%,在当前权重空间迁移技术中量化上超越,确立了模型可互操作性的新型态。
引用
@article{arxiv.2510.17902,
title = {Activation Manifold Projection: Liberating Task-Specific Behaviors from LLM Architectures},
author = {Al Kari},
journal= {arXiv preprint arXiv:2510.17902},
year = {2026}
}