钓取鲤鱼王:自动检测大语言模型中的训练不足词元
计算与语言
2024-09-30 v2
摘要
语言模型中分词器创建与模型训练之间的脱节,使得特定输入(如声名狼藉的 SolidGoldMagikarp 词元)能够诱发不需要的模型行为。尽管在各种模型中都观察到了此类“故障词元”——即存在于分词器词表中但在模型训练期间几乎或完全缺席的词元——但一直缺乏识别和处理它们的可靠方法。我们对大语言模型分词器进行了全面分析,专门针对检测训练不足词元这一问题。通过结合分词器分析、基于模型权重的指标以及提示技术,我们开发了自动检测这些有问题词元的新颖且有效的方法。我们的发现证明了此类词元在多种模型中的普遍存在,并为提高语言模型的效率和安全性提供了见解。
引用
@article{arxiv.2405.05417,
title = {Fishing for Magikarp: Automatically Detecting Under-trained Tokens in Large Language Models},
author = {Sander Land and Max Bartolo},
journal= {arXiv preprint arXiv:2405.05417},
year = {2024}
}
备注
16 pages, 6 figures. Accepted at EMNLP 2024, main track. For associated code, see https://github.com/cohere-ai/magikarp/