中文

基于GPT-2架构的印尼语语言模型自适应内联记忆系统:面向巴塔克语和闽南语的TOBA LM

计算与语言 2026-03-12 v1 计算机与社会

摘要

本研究提出了TOBA-LM,一个基于GPT-2架构、包含12亿参数的三语语言模型,训练语料涵盖印尼语、巴塔克语和马拉格巴语,使用音节-黏着分词方法。该架构集成了内联记忆机制,一种基于n-gram的自适应记忆系统,拥有50万乘768维的嵌入表,通过双-gram和三-gram路径捕获形态学依赖。经验结果表明,训练效率达到80%,仅经过12,973步,损失值从6.4降至1.7996——显著快于传统Transformer架构,后者需超过70,000步才能实现相当的收敛。这些发现确认,外部统计记忆的集成显著降低了在资源有限条件下开发区域语言模型的计算需求。

关键词

引用

@article{arxiv.2603.10006,
  title  = {Adaptive Engram Memory System for Indonesian Language Model: Generative AI Based on TOBA LM for Batak and Minang Language},
  author = {Hokky Situngkir and Kevin Siringoringo and Andhika Bernard Lumbantobing},
  journal= {arXiv preprint arXiv:2603.10006},
  year   = {2026}
}

备注

8 pages, 5 figures