中文

通过学习型嵌入传播促进大语言模型的俄语适应

计算与语言 2024-12-31 v1 人工智能

摘要

大语言模型 (LLM) 技术的快速发展导致强大的开源指令调优LLM出现,这些模型的文本生成质量与GPT-4等最先进模型相当。尽管如此,此类模型的作者并未披露用于复制结果的训练数据,从而使这些成就局限于模型专有范围。由于这些开源模型也是多语言的,这反过来减少了训练特定语言LLM的优势,因为改进的推理计算效率成为唯一可保证的优势。更具成本效益的选项,如词汇扩展和随后的继续预训练,也因缺乏高质量指令调优数据而受到阻碍,因为这是导致LLM解决任务能力的主要因素。为解决这些限制并降低语言适应管道的成本,我们提出了学习型嵌入传播 (LEP)。与现有方法不同,我们的方法由于对现有LLM知识影响最小,这些知识我们通过 novel ad-hoc 嵌入传播程序进行强化,允许跳过指令调优步骤,并直接将新语言知识植入任何现有指令调优变体。我们对四个俄语词汇适应(针对LLaMa-3-8B和Mistral-7B)进行了评估,结果表明LEP在训练数据规模要求方面具有更低的要求,性能与OpenChat 3.5和LLaMa-3-8B-Instruct相当,通过自校准和继续调优进一步提升了任务解决能力。

关键词

引用

@article{arxiv.2412.21140,
  title  = {Facilitating large language model Russian adaptation with Learned Embedding Propagation},
  author = {Mikhail Tikhomirov and Daniil Chernyshev},
  journal= {arXiv preprint arXiv:2412.21140},
  year   = {2024}
}

备注

Preprint version of an article published in the Journal of Language and Education. Copyright held by the owner/author(s). Publication rights licensed to the Journal of Language and Education