中文

神经器官移植(NOT):面向 Transformer 模型的基于检查点的模块化适配

机器学习 2026-01-21 v1 人工智能

摘要

我们引入了神经器官移植(NOT),一种模块化适配框架,使训练好的 Transformer 层能够作为可重用的可迁移检查点用于领域适配。与将训练参数与特定模型实例和训练数据紧密耦合的传统微调方法不同,NOT 从预训练模型中提取连续的层子集(“供体器官”),在特定领域数据上独立训练它们,并将其保存为独立的检查点文件,这些文件可以在不访问原始训练数据的情况下移植到兼容的受体模型中。通过对涵盖 124M 到 20B 参数的三种仅解码器 Transformer 架构(GPT-2、TinyLlama 和 GPT-OSS)进行实验,我们证明供体移植显著优于现有的适配方法,在困惑度上比 LoRA 实现了一个数量级的提升,同时训练速度显著加快。该方法表现出位置依赖性,较早的插入位置产生最佳结果。十亿参数规模下的跨领域迁移揭示了意想不到的正则化益处。这些发现表明,Transformer 中间层可以支持仅解码器架构的高效模块化迁移,通过检查点分发实现隐私保护的专业知识共享。我们注意到该方法目前仅限于仅解码器模型;在基于编码器的架构上的初步实验显示效果有所降低。

关键词

引用

@article{arxiv.2601.13580,
  title  = {Neural Organ Transplantation (NOT): Checkpoint-Based Modular Adaptation for Transformer Models},
  author = {Ahmad Al-Zuraiqi},
  journal= {arXiv preprint arXiv:2601.13580},
  year   = {2026}
}

备注

27 pages, 8 figures, 16 tables. Decoder-only transformers (124M-20B parameters). Complete experimental results and reproducibility details in appendices. Code and checkpoints: https://github.com/zuraiqi/neural-organ-transplant