中文

跨语言模型的顺序级注意力相似性:一种潜在共性

计算与语言 2025-11-10 v1

摘要

本文探讨了一个此前被忽视的重要问题:语言模型(LM)之间的上下文聚合模式是否存在共性?虽然已有研究 investigates 上下文聚合或注意力权重,但通常仅聚焦于单个模型或注意力头,缺乏对多种语言模型进行系统性分析以探索其共性。相反,我们关注语言模型之间的共性,这有助于深化对语言模型的理解,甚至可促进跨模型知识迁移。本文引入了从注意力推送(Attention Rollout)的顺序分解中导出的顺序级注意力(Order-Level Attention,OLA),并指出同一序数的 OLA 在不同语言模型间 exhibits显著相似性。进一步发现,OLA 与语法知识之间存在隐式映射。基于这两个发现,我们提出了可迁移的 OLA 适配器(Transferable OLA Adapter,TOA),一种无需训练的跨语言模型适配器迁移方法。具体而言,我们将 OLA 作为统一的语法特征表示,并训练一个以 OLA 为输入的适配器。由于 OLA 在不同语言模型间的相似性,该适配器能够在无需任何参数更新的情况下推广到未见过的语言模型。大量实验表明,TOA 的跨语言模型泛化有效提升了未见语言模型的性能。代码已公开于 https://github.com/jinglin-liang/OLAS。

关键词

引用

@article{arxiv.2511.05064,
  title  = {Order-Level Attention Similarity Across Language Models: A Latent Commonality},
  author = {Jinglin Liang and Jin Zhong and Shuangping Huang and Yunqing Hu and Huiyuan Zhang and Huifang Li and Lixin Fan and Hanlin Gu},
  journal= {arXiv preprint arXiv:2511.05064},
  year   = {2025}
}

备注

Accepted by NeurIPS 2025