中文

Typhoon-S:面向主权大语言模型的最小化开放后训练

计算与语言 2026-01-27 v1 人工智能

摘要

大语言模型(LLMs)发展迅速;然而,大多数最先进的模型主要在英语和中文等高资源语言中进行训练和评估,且通常由少数能够获取大规模算力和数据的机构开发。这种把关行为对主权环境造成了实际障碍,在这些环境中,区域或国家规模的机构或领域所有者必须在有限的资源和严格的透明度约束下运行,同时保留对模型权重、训练数据和部署的控制与理解。为此,我们确定了两个核心要求:(1)可采纳性,即将基础模型转化为通用助手的能力;(2)主权能力,即执行高风险、特定区域任务(例如,当地语言的法律推理和文化知识)的能力。我们研究了是否可以在不扩展大规模指令语料库、不依赖复杂偏好调优管道和大规模强化微调(RFT)的情况下实现这些要求。我们提出了 Typhoon S,这是一种最小且开放的后训练方案,结合了监督微调、策略蒸馏和小规模 RFT。以泰语作为代表性案例研究,我们证明了我们的方法将主权适配和通用基础模型转化为具有强大通用性能的指令微调模型。我们进一步表明,使用 InK-GRPO(GRPO 的一种扩展,通过在 GRPO 损失中增加下一词预测损失来增强 GRPO 损失)的小规模 RFT,在保留通用能力的同时,提高了泰语法律推理和泰语特定知识。我们的结果表明,精心设计的后训练策略可以减少所需的指令数据和计算规模,为在学术规模资源下开发高质量主权 LLM 提供了实用路径。

关键词

引用

@article{arxiv.2601.18129,
  title  = {Typhoon-S: Minimal Open Post-Training for Sovereign Large Language Models},
  author = {Kunat Pipatanakul and Pittawat Taveekitworachai},
  journal= {arXiv preprint arXiv:2601.18129},
  year   = {2026}
}

备注

19 pages. Code is publicly available at https://github.com/scb-10x/typhoon-s . Datasets and model weights are available at https://huggingface.co/collections/typhoon-ai/typhoon-s