中文

H-Net++:面向形态学丰富语言的无分词器层次化动态块分割模型

计算与语言 2025-08-08 v1 人工智能

摘要

字节级语言模型消除了脆弱的分词器,但在形态学丰富的语言(MRLs)中面临计算挑战,因为单个词汇可能跨越多个字节。我们提出H-NET++,一种通过端到端训练学习 linguistically-informed 分段的层次化动态块分割模型。关键创新包括:(1) 用于跨块注意力的轻量级Transformer上下文混合器(190万参数)、(2) 用于文档级一致性的两级潜在超先验、(3) 对正交 artifacts(如波斯语 ZWNJ)的专门处理,以及(4) 基于课程的训练与阶段性序列长度。 在1.4B标记的波斯语语料库上,H-NET++实现了最先进的成果:相较于BPE-based GPT-2-fa 实现了0.159 BPB的压缩率提升(压缩效率提高12%),在ParsGLUE上取得5.4pp的提升,对ZWNJ腐化的鲁棒性提高53%,在黄金形态边界上实现73.8%的F1分数。我们学习到的块与波斯语形态学对齐,无需显式监督,表明层次化动态块分割为MRLs提供了一种高效且无需分词器的解决方案,同时保持了计算效率。

关键词

引用

@article{arxiv.2508.05628,
  title  = {H-Net++: Hierarchical Dynamic Chunking for Tokenizer-Free Language Modelling in Morphologically-Rich Languages},
  author = {Mehrdad Zakershahrak and Samira Ghodratnama},
  journal= {arXiv preprint arXiv:2508.05628},
  year   = {2025}
}