勿将分词器视为理所当然:它们是大型语言模型的核心设计决策
计算与语言
2026-01-27 v2 人工智能
机器学习
摘要
分词是所有大型语言模型的基础,但它仍是一个理论化不足且设计不一致的组件。诸如字节对编码(BPE)等常见子词方法提供了可扩展性,但往往与语言结构不一致,放大偏差,并在不同语言和领域间浪费模型容量。本文将分词重新定义为核心建模决策而非预处理步骤。我们主张建立一个上下文感知框架,在语言学、领域和部署考量的指导下,整合分词器与模型的协同设计。标准化评估与透明报告对于使分词选择具备可问责性与可比性至关重要。将分词视为核心设计问题而非技术上的事后补充,可以产生更公平、更高效且更具适应性的语言技术。
引用
@article{arxiv.2601.13260,
title = {Stop Taking Tokenizers for Granted: They Are Core Design Decisions in Large Language Models},
author = {Sawsan Alqahtani and Mir Tafseer Nayeem and Md Tahmid Rahman Laskar and Tasnim Mohiuddin and M Saiful Bari},
journal= {arXiv preprint arXiv:2601.13260},
year = {2026}
}
备注
Accepted to EACL 2026 (long, main). The first two authors contributed equally