中文

通过模型合并将语言特定大语言模型适配为推理模型 -- 开放配方

计算与语言 2025-03-28 v3 人工智能

摘要

本文探讨了数据选择和模型合并方法,旨在将具有 DeepSeek R1 等先进推理能力整合到语言特定大语言模型(LLM)中,尤其关注泰语 LLM。我们的目标是在提升语言特定 LLM 推理能力的同时,维持其目标语言能力。DeepSeek R1 在推理方面表现卓越,但主要惠及高资源语言,如英语和中文。然而,低资源语言因英语主导的训练数据和模型优化而被忽视,导致性能受限。这一局限导致代码切换不可靠,低资源语言任务效果下降。与此同时,本地和区域性 LLM 倡议尝试通过开发语言特定 LLM 来弥合这一差距,聚焦于改善本地语言学真实性。我们展示,仅凭公开数据集和 120 美元的计算预算,即可将语言特定 LLM 的推理能力提升至与 DeepSeek R1 相当水平,而不会损害其目标语言任务性能。

关键词

引用

@article{arxiv.2502.09056,
  title  = {Adapting Language-Specific LLMs to a Reasoning Model in One Day via Model Merging -- An Open Recipe},
  author = {Kunat Pipatanakul and Pittawat Taveekitworachai and Potsawee Manakul and Kasima Tharnpipitchai},
  journal= {arXiv preprint arXiv:2502.09056},
  year   = {2025}
}

备注

9 pages