中文

超越 Transformer:状态空间与混合架构的 In-Context Learning 深入探究

计算与语言 2026-03-02 v2 人工智能

摘要

我们对在-state-of-the-art transformer、state-space 和混合大语言模型上进行的 in-context learning (ICL)进行深入评估,涵盖两个知识类 ICL 任务类别。通过结合行为探针和干预方法,我们发现尽管不同架构的大语言模型在任务性能上可以相似,但其内部机制可能仍有差异。我们发现负责 ICL 的函数向量 (FVs) 主要位于自注意力和 Mamba 层中,并推测 Mamba2 使用不同于 FVs 的机制来执行 ICL。FVs 在涉及参数知识检索的 ICL 中更为重要,但在情境知识理解的 ICL 中不重要。我们的工作有助于更细致地理解不同架构和任务类型之间的差异。方法上,我们的做法也突显了结合行为和机制分析来探讨大语言模型能力的重要性。

关键词

引用

@article{arxiv.2510.23006,
  title  = {Understanding In-Context Learning Beyond Transformers: An Investigation of State Space and Hybrid Architectures},
  author = {Shenran Wang and Timothy Tin-Long Tse and Jian Zhu},
  journal= {arXiv preprint arXiv:2510.23006},
  year   = {2026}
}