中文

通过韩语案例研究拓展开源大语言模型的基础语言能力

计算与语言 2025-09-05 v1 人工智能 机器学习

摘要

我们介绍了 Llama-3-Motif,这是一个由 1020 亿参数构成的语言模型,专为增强韩语能力而设计,同时保持在英语方面的强大性能。基于 Llama 3 架构构建的 Llama-3-Motif 采用包括 LlamaPro 和遮蔽结构增长在内的先进训练技术,有效地对模型进行规模化训练,而不改变其核心 Transformer 架构。借助 MoAI 平台在超大规模 GPU 集群上进行高效训练,我们对 Llama-3-Motif 使用精心挑选的平衡包含韩语和英语数据的数据集进行优化。Llama-3-Motif 在韩语专项基准测试上表现良好,超越了现有模型,达到与 GPT-4 相当的效果。

关键词

引用

@article{arxiv.2509.03972,
  title  = {Expanding Foundational Language Capabilities in Open-Source LLMs through a Korean Case Study},
  author = {Junghwan Lim and Gangwon Jo and Sungmin Lee and Jiyoung Park and Dongseok Kim and Jihwan Kim and Junhyeok Lee and Wai Ting Cheung and Dahye Choi and Kibong Choi and Jaeyeon Huh and Beomgyu Kim and Jangwoong Kim and Taehyun Kim and Haesol Lee and Jeesoo Lee and Dongpin Oh and Changseok Song and Daewon Suh},
  journal= {arXiv preprint arXiv:2509.03972},
  year   = {2025}
}