审视LLM安全评估官:关于大语言模型安全评估的鲁棒性元评估
机器学习
2025-03-07 v1 密码学与安全
摘要
基于大语言模型(Large Language Model,LLM)的评估官构成了离线基准测试、自动红队测试和在线警戒等关键安全评估过程的基础。这一广泛需求引出了一个关键问题:我们能否信赖这些评估官的评估?本文突显了通常被忽视的两个关键挑战:(i)野外评估,其中诸如提示敏感性和分布迁移等因素可能影响性能,且(ii)针对评估官的对抗性攻击。我们通过对常用安全评估官的研究,强调了这些挑战的重要性,表明即使小的改变(例如模型输出的样式)也可能导致同一数据集上虚假负率提高最高可达0.24,而针对模型生成的对抗性攻击则可能使某些评估官在100%的有害生成被误判为安全的情况下失效。这些发现揭示了常用元评估基准的缺口,以及当前LLM评估官鲁棒性的弱点,表明在某些评估官下,低攻击成功率可能制造虚假的安全感。
引用
@article{arxiv.2503.04474,
title = {Know Thy Judge: On the Robustness Meta-Evaluation of LLM Safety Judges},
author = {Francisco Eiras and Eliott Zemour and Eric Lin and Vaikkunth Mugunthan},
journal= {arXiv preprint arXiv:2503.04474},
year = {2025}
}
备注
Accepted to the ICBINB Workshop at ICLR'25