中文

通过潜在语义对齐实现跨尺度语言模型知识迁移

流体动力学 2025-11-12 v1

摘要

语言模型(LMs)在参数中编码了大量知识,但如何以细粒度方式迁移此类知识(即参数知识迁移,PKT)仍不明确。核心挑战在于,当源模型和目标模型在结构和参数上存在差异时,如何使跨尺度迁移有效且高效,这使得直接参数重用受到神经不兼容性的严格限制。本文识别出潜在语义对齐是跨尺度知识迁移的关键前提。我们的做法不直接移动层参数,而是将激活值作为迁移介质。\textsc{SemAlign}包含两个阶段:一个\emph{层归因}阶段,对任务相关的源层进行归因,并为每个目标层选择恰好一个源层;以及\emph{语义对齐}阶段,对它们进行逐层配对并优化目标模型,同时利用源端语义监督。对齐过程在潜在空间中通过语义分解和重构完成。在浅层到深层迁移期间,仅使目标模型的前沿层可训练。该层目标通过匹配以对齐后的监督残差引起的中心化token-token关系几何来监督该层的残差贡献,而输出KL保持源级别的预测行为。因此,迁移介质既不是参数块,也不是绝对隐藏状态,而是由配对源层监督所诱导的目标空间残差几何。基于四个基准的评估表明,\textsc{SemAlign}的有效性得到验证,进一步分析确认,语义分解和重构为跨尺度知识迁移提供了稳定机制。

关键词

引用

@article{arxiv.2510.24207,
  title  = {High-energy droplet collisions in multi-interacting hollow cone sprays},
  author = {Narendra Dev and Varun Kulkarni and Sivakumar Deivandren},
  journal= {arXiv preprint arXiv:2510.24207},
  year   = {2025}
}

备注

41 pages, 21 figures. Submitted to International Journal of Multiphase Flow