中文

AnomaLLMy——通过低置信度单 token 预测检测黑盒 LLM 中的异常 token

计算与语言 2024-07-01 v1 人工智能

摘要

本文介绍了AnomaLLMy,这是一种用于检测黑盒大语言模型(LLM)中异常 token 的新型技术。该技术利用低置信度单 token 预测作为一种成本效益高的指示器,来识别模型行为中的不规则现象,旨在解决异常 token 降低模型质量和可靠性的问题。在cl100k_base数据集上验证了该方法,即GPT-4的 token 集。AnomaLLMy检测到413个主要异常和65个次要异常,仅花费24.39美元的API信用证明了该方法的高效。该研究的见解预计将有助于提高LLM的鲁棒性和准确性,特别是在tokenizer的开发和评估方面。

关键词

引用

@article{arxiv.2406.19840,
  title  = {AnomaLLMy -- Detecting anomalous tokens in black-box LLMs through low-confidence single-token predictions},
  author = {Waligóra Witold},
  journal= {arXiv preprint arXiv:2406.19840},
  year   = {2024}
}

备注

6 pages