你的安全度量标准有多安全?基于自动拼接测试的度量可靠性评估
人工智能
2025-02-14 v2
摘要
考虑一种旨在过滤来自大型语言模型(LLM)不安全响应的有害性评估度量标准。在对单个有害提示-响应对应用时,它会通过 assigning 高风险分数正确地将其标记为不安全。然而,如果将这些对拼接在一起,度量标准的决策意外地反转——将组合内容标记为安全,得分较低,导致有害文本绕过过滤器。我们发现,多个安全度量标准,包括高级度量标准如基于 GPT 的评判器,都表现出这种非安全行为。此外,它们对输入顺序高度敏感:当安全内容位于前面时,响应常被分类为安全, regardless of any subsequent harmful content,反之亦然。这些发现凸显了评估安全度量标准可靠性的重要性,即其输出分数的可靠性。为此,我们开发了通用的、基于拼接的自动化测试方法,用于评估这些度量标准的关键属性。在模型安全情境中应用这些测试,揭示了有害性评估的显著不一致性。
引用
@article{arxiv.2408.12259,
title = {How Safe is Your Safety Metric? Automatic Concatenation Tests for Metric Reliability},
author = {Ora Nova Fandina and Leshem Choshen and Eitan Farchi and George Kour and Yotam Perlitz and Orna Raz},
journal= {arXiv preprint arXiv:2408.12259},
year = {2025}
}