中文

大型语言模型中的故障 Token:分类体系与有效检测

计算与语言 2024-04-22 v3 软件工程

摘要

随着大型语言模型(LLM)在各个领域的应用不断扩大,全面调查其不可预见的行为和由此产生的后果变得势在必行。在本研究中,我们介绍并系统地探索了“故障 token”现象,这些 token 是由成熟的分词器产生的异常 token,可能会损害模型的响应质量。具体而言,我们在七个最受欢迎的 LLM 上进行了实验,使用了三种不同的分词器,共涉及 182,517 个 token。我们对已识别的故障 token 以及 LLM 在与故障 token 交互时表现出的症状进行了分类。基于我们观察到的故障 token 往往在嵌入空间中聚类的现象,我们提出了 GlitchHunter,一种新颖的基于迭代聚类的技术,用于高效检测故障 token。评估表明,我们的方法在八个开源 LLM 上显著优于三种基线方法。据我们所知,我们提出了关于故障 token 的首次全面研究。我们的新检测方法进一步为缓解 LLM 中与分词相关的错误提供了有价值的见解。

关键词

引用

@article{arxiv.2404.09894,
  title  = {Glitch Tokens in Large Language Models: Categorization Taxonomy and Effective Detection},
  author = {Yuxi Li and Yi Liu and Gelei Deng and Ying Zhang and Wenjia Song and Ling Shi and Kailong Wang and Yuekang Li and Yang Liu and Haoyu Wang},
  journal= {arXiv preprint arXiv:2404.09894},
  year   = {2024}
}