中文

CUTE:测量LLMs对其标记的理解程度

计算与语言 2024-10-03 v2

摘要

大型语言模型(LLM)在各种任务上表现出惊人的性能。大多数LLM将文本分割为多个字符的标记,并将其作为原子单元处理,而无需直接访问单个字符。这引出一个问题:LLM在多大程度上能够学习正字信息?为此,我们提出一个新的基准测试CUTE,包含一系列旨在测试LLM正字知识的任务。我们对流行的LLM进行CUTE评估,发现大多数LLM似乎知道其标记的拼写,却未能有效地利用这一信息来操作文本,这质疑了这种知识的可通用性。

关键词

引用

@article{arxiv.2409.15452,
  title  = {CUTE: Measuring LLMs' Understanding of Their Tokens},
  author = {Lukas Edman and Helmut Schmid and Alexander Fraser},
  journal= {arXiv preprint arXiv:2409.15452},
  year   = {2024}
}

备注

Accepted to EMNLP 2024 main conference