中文

OpenSeal:通过平行数据构建面向东南亚的开源语言模型

计算与语言 2026-02-03 v1 人工智能

摘要

大型语言模型(LLM)已被证明是有效的自然语言处理(NLP)应用工具。虽然许多 LLM 是多语言的,但大多数仍以英语为中心,对低资源语言表现较差。最近开发了数个面向东南亚的 LLM,但没有一个是真正开源的,因为它们不公开披露训练数据。真正的开源模型对于透明度以及更深入、更精确地理解 LLM 内部和开发(包括偏见、泛化和多语言性)至关重要。受最近表明平行数据在改善多语言性能方面有效的推动,我们进行受控且全面的实验,以研究平行数据在 LLM 持续预训练中的有效性。我们的发现表明,仅使用平行数据是扩展 LLM 到新语言的最有效方法。仅用 3470 亿 token 的平行数据和 180 小时在 8 台 NVIDIA H200 GPU 上,我们构建了 OpenSeal,成为首个真正开源的东南亚 LLM,性能与规模相似的现有模型相当。

关键词

引用

@article{arxiv.2602.02266,
  title  = {OpenSeal: Good, Fast, and Cheap Construction of an Open-Source Southeast Asian LLM via Parallel Data},
  author = {Tan Sang Nguyen and Muhammad Reza Qorib and Hwee Tou Ng},
  journal= {arXiv preprint arXiv:2602.02266},
  year   = {2026}
}