中文

稀疏大脑也是灵活大脑:基于认知负荷的动态激活机制

计算与语言 2025-02-27 v1

摘要

密集型大语言模型(LLM)面临效率瓶颈,因为它们不管输入复杂度如何,都严格激活所有参数。虽然已有稀疏方法(静态剪枝或动态激活)部分缓解了此问题,但它们要么缺乏对上下文或模型结构需求的适应性,要么造成巨大的计算开销。以人类大脑的双过程机制——预测编码(N400)用于主干稀疏,结构重分析(P600)用于复杂上下文——为灵感,本文提出 CLADA,即 \textit{\textbf{C}ognitive-\textbf{L}oad-\textbf{A}ware \textbf{D}ynamic \textbf{A}ctivation} 框架,融合统计稀疏与语义适应性。我们的关键见解是,LLM 激活呈现两种互补模式:1)由序列级前缀信息驱动的 \textit{全局统计稀疏};2)由认知负荷指标(如惊讶值和熵)调制的 \textit{局部语义适应性}。CLADA 采用分层阈值策略:来自离线误差控制优化的基线确保 40%+ 稀疏率,实时认知信号动态调整。对六个主流 LLM 和九个基准测试的评估表明,CLADA 实现 \textbf{约 20% 的平均加速},并在 <2% 准确率下运行,优于 Griffin(5%+ 性能下降)和 TT(几乎无加速)。关键的是,我们通过多水平回归分析(稀疏-适应性协同 R2=0.17R^2=0.17)建立了神经语言学事件相关电位(ERP)组件与 LLM 效率机制的首个正式联系。无需重新训练或修改网络结构,CLADA 提供了一个可部署的资源感知 LLM 推理解决方案,同时推动了生物学启发的 AI 设计。我们的代码已公开于 \href{https://github.com/Oldify/CLADA}{CLADA}。

关键词

引用

@article{arxiv.2502.19078,
  title  = {Sparse Brains are Also Adaptive Brains: Cognitive-Load-Aware Dynamic Activation for LLMs},
  author = {Yiheng Yang and Yujie Wang and Chi Ma and Lei Yu and Emmanuele Chersoni and Chu-Ren Huang},
  journal= {arXiv preprint arXiv:2502.19078},
  year   = {2025}
}