中文

理解前馈网络在驱动大语言模型多语言行为中的作用

计算与语言 2024-04-23 v1

摘要

大语言模型(LLMs)的多语言能力仍是一个尚未充分探索的领域。在本文中,我们对一个大语言模型系列的多语言能力进行了深入分析,考察了其架构、激活模式以及跨语言的处理机制。我们引入了新的度量标准来探测模型在不同层的多语言行为,并揭示了架构选择对多语言处理的影响。我们的发现揭示了模型前馈网络子层中多语言处理的不同模式。此外,我们发现了某些模型配置中的“过度分层”现象,即增加层深度而不相应调整其他参数可能会降低模型性能。通过语言内和跨语言的比较,我们展示了模型架构、层深度与在多语言上训练的LLMs的多语言处理能力之间的相互作用。

关键词

引用

@article{arxiv.2404.13855,
  title  = {Understanding the role of FFNs in driving multilingual behaviour in LLMs},
  author = {Sunit Bhattacharya and Ondřej Bojar},
  journal= {arXiv preprint arXiv:2404.13855},
  year   = {2024}
}

备注

10 pages