中文

发现大型语言模型中的解耦功能模块

机器学习 2026-03-19 v1 计算与语言

摘要

理解大型语言模型(LLM)的内部功能组织对于提高其可信度和性能至关重要。然而,LLM如何将不同功能组织到模块中仍高度未知。为弥合这一差距,我们提出了一种无监督LLM 跨层模块发现(ULCMOD)框架,同时对整个LLM中大量神经元解耦到模块中,同时发现与这些模块相关的输入样本主题。我们的框架引入了新的目标函数和高效的迭代解耦(IterD)算法。广泛的实验表明,我们的方法发现的高质量、解耦模块能够捕获更有意义的语义信息,并在各种下游任务中实现卓越的性能。此外,我们的定性分析揭示,所发现的模块表现出语义一致性,对应于可解释的专业化,并在LLM内部呈现清晰的空间和层次结构组织。我们的工作为解释LLM的功能模块提供了一种新工具,填补了LLM可解释性研究中的关键空白。

关键词

引用

@article{arxiv.2603.17823,
  title  = {Discovering Decoupled Functional Modules in Large Language Models},
  author = {Yanke Yu and Jin Li and Ying Sun and Ping Li and Zhefeng Wang and Yi Zheng},
  journal= {arXiv preprint arXiv:2603.17823},
  year   = {2026}
}

备注

AAAI-26 Oral