中文

SubTokenTest:面向真实世界子词元理解的实际基准

计算与语言 2026-01-15 v1 人工智能

摘要

大型语言模型(LLM)的最新进展显著增强了其推理能力。然而,它们在基本的字符级任务上仍然存在困难,例如计算单词中的字母数量,这一问题根源于其分词过程。虽然现有的基准通过基本字符操作突出了这一弱点,但由于缺乏实际相关性,此类失败往往被忽视。然而,许多真实世界的应用,如浏览基于文本的地图或解释结构化表格,严重依赖于精确的子词元理解。在这方面,我们引入了 SubTokenTest,这是一个通过实用的、效用驱动的任务来评估子词元理解的综合性基准。我们的基准包含四个领域的十项任务,并通过将性能与复杂推理解耦来隔离与分词相关的失败。我们对九个先进的 LLM 进行了全面评估。此外,我们研究了测试时扩展对子词元推理的影响,并探讨了字符级信息如何在隐藏状态中被编码。

关键词

引用

@article{arxiv.2601.09089,
  title  = {SubTokenTest: A Practical Benchmark for Real-World Sub-token Understanding},
  author = {Shuyang Hou and Yi Hu and Muhan Zhang},
  journal= {arXiv preprint arXiv:2601.09089},
  year   = {2026}
}