大语言模型尚不能可靠地评判?——LLM-as-a-Judge 鲁棒性的全面评估
密码学与安全
2025-11-18 v2
摘要
大型语言模型(LLMs)在多种任务中展现出卓越能力,推动了 LLM-as-a-Judge 系统在自动评估(包括红队测试和基准测试)中的开发和广泛应用。然而,这些系统容易受到能够操纵评估结果的对抗攻击,引发对其鲁棒性和可信性的关键担忧。现有的 LLM 评判系统评估方法往往碎片化,缺乏全面的鲁棒性评估统一框架。此外,提示模板设计和模型选择对评判鲁棒性的影响很少被探索,其在真实部署中的性能在很大程度上尚未得到验证。为解决这些不足,我们引入了 RobustJudge,一个完全自动化且可扩展的框架,旨在系统评估 LLM-as-a-Judge 系统的鲁棒性。具体而言,RobustJudge 考察了 15 种攻击方法和 7 种防御策略在 12 个模型上的有效性(RQ1),研究了提示模板设计和模型选择的影响(RQ2),并评估了真实部署的安全性(RQ3)。我们的研究得出三个关键发现:(1)LLM-as-a-Judge 系统对 PAIR 和组合攻击等高度脆弱,而重标记化和基于 LLM 的检测器等防御机制可提供增强保护;(2)鲁棒性在不同提示模板间差异显著(高达 40%);(3)在阿里巴巴的 PAI 平台上部署 RobustJudge 发现了此前未被发现的漏洞。这些结果为构建可信的 LLM-as-a-Judge 系统提供了实用见解。
引用
@article{arxiv.2506.09443,
title = {LLMs Cannot Reliably Judge (Yet?): A Comprehensive Assessment on the Robustness of LLM-as-a-Judge},
author = {Songze Li and Chuokun Xu and Jiaying Wang and Xueluan Gong and Chen Chen and Jirui Zhang and Jun Wang and Kwok-Yan Lam and Shouling Ji},
journal= {arXiv preprint arXiv:2506.09443},
year = {2025}
}