中文

预训练 Transformer 中的涌现模块化

计算与语言 2023-10-31 v2 机器学习

摘要

本研究考察了预训练 Transformer 中模块化的存在性,这一特征常见于人脑且被认为对通用智能至关重要。类比于人脑,我们考虑模块化的两个主要特征:(1) 神经元的功能专门化:我们评估每个神经元是否主要专门于某一功能,发现答案是肯定的。(2) 基于功能的神经元分组:我们探索寻找一种将神经元按功能分组为模块的结构,每个模块为其对应功能工作。鉴于可能结构数量巨大,我们聚焦于 Mixture-of-Experts 这一有前景的候选方案,它将神经元划分为专家并通常针对不同输入激活不同专家。实验结果表明存在功能专家,其中聚集了专门于某一功能的神经元。此外,扰动功能专家的激活会显著影响对应功能。最后,我们研究模块化如何在预训练期间涌现,发现模块结构在早期阶段即稳定,快于神经元稳定。这表明 Transformer 先构建模块结构,再学习细粒度神经元功能。我们的代码与数据可在 https://github.com/THUNLP/modularity-analysis 获取。

关键词

引用

@article{arxiv.2305.18390,
  title  = {Emergent Modularity in Pre-trained Transformers},
  author = {Zhengyan Zhang and Zhiyuan Zeng and Yankai Lin and Chaojun Xiao and Xiaozhi Wang and Xu Han and Zhiyuan Liu and Ruobing Xie and Maosong Sun and Jie Zhou},
  journal= {arXiv preprint arXiv:2305.18390},
  year   = {2023}
}

备注

Findings of ACL 2023