中文

跨语言模型架构的神经激活模式:认知任务性能的全面分析

计算与语言 2026-05-18 v1 机器学习

摘要

本文 presents 对六种不同大型语言模型 (LLM) 架构之间神经激活模式的全面分析,考察其在十二个认知任务类别上的表现。通过系统测量最终激活值、注意力熵和稀疏性模式,我们揭示了编码器和解码器架构在处理多样化认知任务时的根本差异。我们的分析在144种任务-模型组合中表明,数学推理在所有架构中始终产生最高的注意力熵,而解码器模型相较于编码器模型表现出显著更高的稀疏性模式。这些发现为理解现代语言模型的计算特征及其任务特定神经行为提供了关键见解,对于大数据应用中的模型选择和优化具有重要意义。

关键词

引用

@article{arxiv.2605.15436,
  title  = {Neural Activation Patterns Across Language Model Architectures: A Comprehensive Analysis of Cognitive Task Performance},
  author = {Mahdi Naser-Moghadasi and Faezeh Ghaderi},
  journal= {arXiv preprint arXiv:2605.15436},
  year   = {2026}
}

备注

8 pages, accepted at IEEE BigData 2025