GlitchProber:推动大型语言模型中故障 token 检测与缓解的有效方法
计算与语言
2024-09-24 v2 人工智能
摘要
大型语言模型 (LLM) 已在自然语言处理领域取得非凡成功。然而,其内部机制的黑箱特性带来了诸多关于可信度和可解释性的关注。近期研究发现了模型词汇空间中一类异常 token,命名为“故障 token”。一旦这些 token 被包含在输入中,可能导致模型产生不正确、无关甚至有害的结果,严重削弱了 LLM 的可靠性和实用性。在本工作中,我们旨在增强对故障 token 的理解,并提出检测和缓解技术。首先,我们揭示了故障 token 对 LLM 引起的特征特征,证据表明注意力模式和中间模型层动态信息分布存在显著偏差。基于这些洞见,我们开发了 GlitchProber,用于高效的故障 token 检测和缓解。GlitchProber 利用小规模抽样、主成分分析进行加速特征提取,并使用简单分类器进行高效词汇筛选。进一步地,GlitchProber 对异常的模型中间层值进行校正,以缓解故障 token 的破坏性影响。在评估五个主流开源 LLM 时,GlitchProber 显示出比现有方法更高的效率、精度和召回率,平均 F1 分数为 0.86,平均修复率为 50.06%。GlitchProber 揭示了应对故障 token 挑战的新路径,并激发了未来研究更可靠、可解释 LLM 的热情。
引用
@article{arxiv.2408.04905,
title = {GlitchProber: Advancing Effective Detection and Mitigation of Glitch Tokens in Large Language Models},
author = {Zhibo Zhang and Wuxia Bai and Yuxi Li and Mark Huasong Meng and Kailong Wang and Ling Shi and Li Li and Jun Wang and Haoyu Wang},
journal= {arXiv preprint arXiv:2408.04905},
year = {2024}
}