中文

超越神经不兼容性:通过潜在语义对齐实现语言模型中的跨尺度知识迁移

计算与语言 2026-05-19 v2 机器学习

摘要

语言模型(LM)在其参数中编码了大量知识,但目前尚不清楚如何以细粒度方式迁移这些知识,即参数化知识迁移(PKT)。核心挑战在于,当源模型和目标模型在架构和参数化上存在差异时,如何使跨尺度迁移既有效又高效,因为直接参数复用受到神经不兼容性的严重限制。在本文中,我们识别出潜在语义对齐是跨尺度知识迁移的关键前提。我们的方法不直接移动层参数,而是以激活值作为迁移媒介。SemAlign 包含两个阶段:一个层归因阶段,用于归因任务相关的源层并为每个目标层精确选择一个源层;以及一个语义对齐阶段,逐层配对它们并通过源端语义监督优化目标模型。对齐在潜在空间中通过语义分解与重组合来完成。在浅层到深层的迁移过程中,仅前沿目标层是可训练的。层目标通过将中心化的词-词关系几何与对齐的监督残差进行匹配来监督该层的残差贡献,而输出 KL 散度则保持源层级的预测行为。因此,迁移的媒介既不是参数块也不是绝对隐藏状态,而是由配对源层监督所诱导的目标空间残差几何。在四个基准上的评估验证了 SemAlign 的有效性,进一步分析确认语义分解与重组合为跨尺度知识迁移提供了稳定的机制。

关键词

引用

@article{arxiv.2510.24208,
  title  = {Beyond Neural Incompatibility: Cross-Scale Knowledge Transfer in Language Models through Latent Semantic Alignment},
  author = {Jian Gu and Aldeida Aleti and Chunyang Chen and Hongyu Zhang},
  journal= {arXiv preprint arXiv:2510.24208},
  year   = {2026}
}

备注

an early-stage version