CharBench:评估字符级任务中分词作用的基准
计算与语言
2026-04-08 v3
摘要
需要字符级推理的任务(如计数或定位单词中的字符)对当代语言模型仍具有挑战性。常见假设是,语言模型依赖子词单元而非字符,导致其在字符级任务方面受限,但近期研究对分词的作用结论不一致,导致其影响尚不明确。为解决这一空白,我们引入CharBench,这一包含字符级任务的全面基准,规模是现有替代方案的十倍。我们在CharBench上评估了多样化的领先开源和专有模型,发现其对现代大语言模型构成重大挑战,在某些任务上平均准确率为43.6%和32.3%。我们深入分析了单词的内在属性及其分割为单元与模型性能之间的对应关系。对于计数任务,我们发现分词属性与正确性的相关性较弱,而查询单词的长度和实际字符计数起更重要作用。相比之下,对于需要词内位置理解的任务,性能与包含所查询字符的单元长度呈负相关,表明较长的单元会遮蔽字符位置信息。我们鼓励后续工作在此引入的基准和评估方法上进行建设,以改进模型在此类任务上的性能。
引用
@article{arxiv.2508.02591,
title = {CharBench: Evaluating the Role of Tokenization in Character-Level Tasks},
author = {Omri Uzan and Yuval Pinter},
journal= {arXiv preprint arXiv:2508.02591},
year = {2026}
}
备注
AAAI-26