中文

分词对 LLaMa 俄语适配的影响

计算与语言 2023-12-06 v1 人工智能

摘要

最新的指令微调大语言模型(LLM)在各类任务上展现出优异的结果,然而,对于非英语输入,它们常常面临性能下降的问题。有证据表明,原因在于预训练数据中语言代表性不足导致的低效分词,这阻碍了对非英语指令的理解,限制了目标语言指令微调的潜力。在这项工作中,我们研究了在 LLaMa 俄语适配的背景下,通过词汇替换来解决该问题的可能性。我们探索了三种词汇适配变体,并在 Saiga 指令微调和 Russian Super Glue 基准微调上测试了它们的性能。自动评估结果表明,词汇替换不仅提高了模型的俄语质量,还加速了微调(35%)和推理(最高 60%),同时降低了内存消耗。对指令微调模型的额外人工评估表明,具有俄语适配词汇表的模型生成的答案比原始的 Saiga-LLaMa 模型具有更高的用户偏好。

关键词

引用

@article{arxiv.2312.02598,
  title  = {Impact of Tokenization on LLaMa Russian Adaptation},
  author = {Mikhail Tikhomirov and Daniil Chernyshev},
  journal= {arXiv preprint arXiv:2312.02598},
  year   = {2023}
}