JAI-1:泰语中心的大型语言模型
计算与语言
2025-10-13 v1
摘要
本技术报告介绍JAI-1,一个拥有750亿参数的泰语中心语言模型。近期的泰语模型主要依赖现有的开源模型,通过应用额外的训练而不进行结构性修改来专门针对泰语进行优化。然而,这种方法风险在于,在注入泰语特定信息时会侵蚀模型参数空间中既有知识,因为为一般任务优化的参数可能与新的语言要求产生冲突。相比之下,JAI-1采用放大策略:从一个较小的、表现优异的英文开源LLM开始,我们扩大了其参数空间,并利用新分配的容量系统性地集成泰语语言知识。这种方法不仅保留了原始模型的通用智能,还建立了一个与其他开源模型独特的架构,使未来的可扩展性增强成为可能。在预训练阶段,JAI-1接受了1.5万亿个token的训练,其中包括超过3000亿个泰语语言token。随后进行了后训练阶段——监督式微调和对齐式微调——使用了超过60万个基于指令的示例。最终模型在泰语中心基准测试(IFEval-TH、MT-Bench-TH和JAI-Hall-Bench)上显示出优于Typhoon2-70B的优异性能,验证了其放大和知识集成框架的有效性。
引用
@article{arxiv.2510.08620,
title = {JAI-1: A Thai-Centric Large Language Model},
author = {Attapol T. Rutherford and Jullajak Karnjanaekarin and Narongkorn Panitsrisit and Pontakorn Trakuekul and Sumana Sumanakul and Natchanon Pollertlam},
journal= {arXiv preprint arXiv:2510.08620},
year = {2025}
}