N-GLARE:一种非生成式、潜在表示高效的大语言模型安全评估器
机器学习
2026-01-09 v2 密码学与安全
摘要
评估大语言模型的安全鲁棒性对于其部署至关重要。然而,主流的Red Teaming方法依赖于在线生成和黑盒输出分析。这些方法不仅代价高昂,而且存在反馈延迟,因而不适用于在训练新模型后进行敏捷诊断。为此,我们提出N-GLARE(Non-Generative, Latent Representation-Efficient LLM Safety Evaluator)。N-GLARE完全 operates on the model's latent representations,无需进行完整文本生成。它通过分析潜在表示的APT(Angular-Probabilistic Trajectory)并引入JSS(Jensen-Shannon Separability)指标来刻画隐藏层动态。实验在40多款模型和20种Red Teaming策略上表明,JSS指标与来自Red Teaming的安全排名高度一致。N-GLARE在生成大量Red Teaming测试时能以不到1%的token成本和运行成本再现其判别趋势,为实时诊断提供一种高效且无输出的评估代理。
引用
@article{arxiv.2511.14195,
title = {N-GLARE: An Non-Generative Latent Representation-Efficient LLM Safety Evaluator},
author = {Zheyu Lin and Jirui Yang and Yukui Qiu and Hengqi Guo and Yubing Bao and Yao Guan},
journal= {arXiv preprint arXiv:2511.14195},
year = {2026}
}