通过词汇适应优化意大利语 LLM:减少 Token fertility 并提升效率
计算与语言
2025-04-25 v1
摘要
预训练大型语言模型 (LLM) 的数量正在稳步增加,但大多数模型主要为英语语言设计。尽管最先进的 LLM 可处理其他语言,但由于语言污染或一定程度的多语言预训练数据,他们并非为非英语语言优化,导致编码效率低下(高 token "fertility")和推理速度较慢。本文全面比较了多种词汇适应技术,用于优化面向意大利语的英语 LLM,并提出了语义对齐词汇适应 (SAVA) 方法,该方法利用神经映射进行词汇替换。SAVA 在多个下游任务上实现了具竞争力的性能,增强了基于 grounding 对齐策略的方法。我们适配了两种 LLM:Mistral-7b-v0.1,通过减少 25% 的 token fertility;Llama-3.1-8B,通过词汇优化减少 10 亿个参数。我们表明,在词汇适应后,这些模型可通过针对目标语言的有限持续训练阶段恢复其性能。最后,我们在各种多选择和生成任务上测试了适配模型的能力。
引用
@article{arxiv.2504.17025,
title = {Optimizing LLMs for Italian: Reducing Token Fertility and Enhancing Efficiency Through Vocabulary Adaptation},
author = {Luca Moroni and Giovanni Puccetti and Pere-Lluis Huguet Cabot and Andrei Stefan Bejgu and Edoardo Barba and Alessio Miaschi and Felice Dell'Orletta and Andrea Esuli and Roberto Navigli},
journal= {arXiv preprint arXiv:2504.17025},
year = {2025}
}