HYPEROFA:基于超网络的扩展大语言模型词汇表至新语言方法
计算与语言
2025-07-15 v2 机器学习
摘要
许多预训练语言模型(PLM)在中低资源语言上表现不佳,主要由于在预训练阶段对这些语言的暴露有限。常见策略是引入针对目标语言的新词汇 token,初始化其嵌入向量,并在目标语言数据上进行持续预训练。其中,OFA(Liu 等,2024a)提出一种基于相似性的子词嵌入初始化启发式方法,既有效又高效。然而,OFA 将目标语言 token 嵌入限制为固定数量源语言嵌入的凸组合,这可能限制了其表达能力。为克服这一限制,我们提出HYPEROFA,一种基于超网络的 token 嵌入初始化方法。该超网络通过源语言 token 将外部多语言词向量空间映射到 PLM 的 token 嵌入空间。训练后,它可以为目标语言 token 生成灵活的嵌入,作为持续预训练的良好起点。实验表明,HYPEROFA 在随机初始化基线和 OFA 均方面表现一致或更优,尤其在持续预训练收敛和下游任务性能方面。我们已公开代码。
引用
@article{arxiv.2504.21018,
title = {HYPEROFA: Expanding LLM Vocabulary to New Languages via Hypernetwork-Based Embedding Initialization},
author = {Enes Özeren and Yihong Liu and Hinrich Schütze},
journal= {arXiv preprint arXiv:2504.21018},
year = {2025}
}
备注
18 pages, 3 figures, 15 tables. After ACL reviews: Corrected typos, Table 4 caption updated and the order of the results changed, numbers are unchanged. This paper will appear in ACL SRW 2025