CUTE:测量LLMs对其标记的理解程度
计算与语言
2024-10-03 v2
摘要
大型语言模型(LLM)在各种任务上表现出惊人的性能。大多数LLM将文本分割为多个字符的标记,并将其作为原子单元处理,而无需直接访问单个字符。这引出一个问题:LLM在多大程度上能够学习正字信息?为此,我们提出一个新的基准测试CUTE,包含一系列旨在测试LLM正字知识的任务。我们对流行的LLM进行CUTE评估,发现大多数LLM似乎知道其标记的拼写,却未能有效地利用这一信息来操作文本,这质疑了这种知识的可通用性。
引用
@article{arxiv.2409.15452,
title = {CUTE: Measuring LLMs' Understanding of Their Tokens},
author = {Lukas Edman and Helmut Schmid and Alexander Fraser},
journal= {arXiv preprint arXiv:2409.15452},
year = {2024}
}
备注
Accepted to EMNLP 2024 main conference