中文

GlitchMiner:通过基于梯度的离散优化挖掘大语言模型中的故障令牌

人工智能 2025-11-11 v5

摘要

故障令牌是触发大语言模型(LLM)不可预测或异常行为的输入,对模型的可靠性和安全性构成重大挑战。现有的检测方法主要依赖于启发式嵌入模式或内部表示中的统计异常,限制了其在不同模型架构上的通用性,并可能遗漏偏离观察模式的异常。我们介绍 GlitchMiner,一种 behavior-driven 的框架,用于通过最大化预测熵来识别故障令牌。GlitchMiner 利用梯度引导的局部搜索策略,有效地探索离散 token 空间,而无需依赖模型特定的启发式或大批量采样。广泛的实验在来自五个主要模型家族的十个 LLM 上进行,表明 GlitchMiner 在检测准确率和查询效率方面 consistently 优于现有方法,为有效的故障令牌发现提供了一种通用且可扩展的解决方案。代码可在 https://github.com/wooozihu/GlitchMiner 获取。

关键词

引用

@article{arxiv.2410.15052,
  title  = {GlitchMiner: Mining Glitch Tokens in Large Language Models via Gradient-based Discrete Optimization},
  author = {Zihui Wu and Haichang Gao and Ping Wang and Shudong Zhang and Zhaoxiang Liu and Shiguo Lian},
  journal= {arXiv preprint arXiv:2410.15052},
  year   = {2025}
}