更安全还是更幸运?作为安全评估器的大语言模型对人为痕迹不具有鲁棒性
计算与语言
2025-07-10 v3 人工智能
摘要
大语言模型(LLMs)越来越多地被用作自动化评估器来评估生成内容的安全性,但其在此角色中的可靠性仍不确定。本研究在一系列关键安全领域评估了11种LLM判断模型,考察了三个关键方面:重复判断任务中的自一致性、与人类判断的一致性,以及对输入人为痕迹(如道歉性或冗长措辞)的敏感性。我们的发现表明,LLM判断器中的偏见可能显著扭曲关于哪个内容来源更安全的最终裁决,从而削弱比较评估的有效性。值得注意的是,仅道歉性语言人为痕迹就可使评估器偏好产生高达98%的偏差。与预期相反,更大的模型并不始终表现出更强的鲁棒性,而更小的模型有时对特定人为痕迹表现出更高的抵抗力。为缓解LLM评估器鲁棒性问题,我们研究了通过多个模型决策聚合的陪审团式评估。尽管这种方法既改善了鲁棒性又增强了与人类判断的一致性,但即使在最佳陪审团配置下,人为痕迹敏感性仍然存在。这些结果凸显了对多元化和抗人为痕迹方法以确保可靠安全评估的迫切需求。
引用
@article{arxiv.2503.09347,
title = {Safer or Luckier? LLMs as Safety Evaluators Are Not Robust to Artifacts},
author = {Hongyu Chen and Seraphina Goldfarb-Tarrant},
journal= {arXiv preprint arXiv:2503.09347},
year = {2025}
}
备注
9 pages, ACL 2025