揭示大型语言模型中的语言区域
计算与语言
2024-05-31 v3
摘要
大型语言模型(LLMs)展现出了显著的跨语言对齐和泛化能力。当前的研究主要集中在提升 LLMs 的跨语言泛化能力上。然而,关于 LLMs 如何实现跨语言对齐的内在机制仍然缺乏研究。从区域划分的角度出发,本文对 LLMs 的语言能力进行了多项研究。我们在 LLMs 中发现了一个对应语言能力的核心区域,约占模型总参数量的 1%。通过将参数置零来移除该核心区域,会导致 30 种不同语言的性能显著下降。此外,该核心区域表现出显著的维度依赖性,对特定维度上甚至单个参数的扰动都会导致语言能力的丧失。此外,我们发现不同语言存在不同的单语区域,对这些特定区域的破坏会大幅降低 LLMs 在相应语言上的熟练度。我们的研究还表明,在进一步预训练期间冻结核心语言区域可以缓解灾难性遗忘(CF)问题,这是 LLMs 进一步预训练期间观察到的一种常见现象。总体而言,探索 LLMs 的功能区域为其智能基础提供了深刻见解。
引用
@article{arxiv.2402.14700,
title = {Unveiling Linguistic Regions in Large Language Models},
author = {Zhihao Zhang and Jun Zhao and Qi Zhang and Tao Gui and Xuanjing Huang},
journal= {arXiv preprint arXiv:2402.14700},
year = {2024}
}
备注
Accepted by ACL 2024. Camera-Ready Version