Thunder-Tok:面向生成式语言模型的韩文文本 Token 数最小化分词器
计算与语言
2025-06-19 v1 人工智能
摘要
本文介绍 Thunder-Tok,这是一个旨在降低 Token 数每词率而不牺牲模型性能的新型韩文分词器。我们的做法采用与韩语语言结构一致的基于规则的预分词方法。我们还创建了一个包含 resemble 语言单位的 token 的种子词汇表,并采用基于分支熵的选择算法。这些技术增加了平均 token 长度,从而降低了 fertility 同时保留了语言信息。实验结果表明,Thunder-Tok 比 BPE 减少约 10% 的 fertility(即减少 10% 的 token 数,提高 10% 的推理速度),在各种下游任务中均未牺牲性能。这些发现表明,我们的基于语言学信息的做法在为语言模型设计高效分词器方面是有效且实用的。
关键词
引用
@article{arxiv.2506.15138,
title = {Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models},
author = {Gyeongje Cho and Yeonkyoun So and Chanwoo Park and Sangmin Lee and Sungmok Jung and Jaejin Lee},
journal= {arXiv preprint arXiv:2506.15138},
year = {2025}
}