BadJudge:LLM作为评判器的后门漏洞
计算与语言
2025-03-04 v1 人工智能
密码学与安全
摘要
本文提出了一种攻击LLM作为评判器(LLM-as-a-Judge)评估范式的新型后门威胁,其中攻击者同时控制候选模型和评判模型。被植入后门的评判模型通过向攻击者分配虚高的分数来损害良性用户的利益。一个简单的单token后门,仅污染1%的评判训练数据,就能使攻击者的得分相对于其合法得分翻三倍。我们系统地划分了三种真实场景下对应的数据访问层级:(1)网络投毒,(2)恶意标注者,(3)权重投毒。这些场景反映了从弱到强的数据访问升级,且与攻击严重程度高度相关。在最弱的假设——网络投毒(1)下,攻击者仍能诱导20%的得分膨胀。同样,在(3)权重投毒场景下,更强的假设使攻击者能将得分从1.5/5膨胀至4.9/5。后门威胁在不同的评判器架构、触发器设计、评估任务和投毒率之间具有泛化性。通过投毒10%的评判训练数据,我们控制了毒性评判器(Guardrails),使其89%的时间将有毒提示误判为无毒,并控制了RAG中的文档重排评判器,使其97%的时间将投毒文档排在第一位。LLM-as-a-Judge正处于伦理与技术的交叉点,模型选择与评估中被误导的社会影响限制了可用的防御工具。在这些挑战中,模型合并作为一种原则性工具出现,能够将后门攻击成功率(ASR)降低至接近0%,同时保持SOTA性能。模型合并的低计算成本和便捷集成到当前LLM评判器训练流程中,使其成为LLM-as-a-Judge场景下后门缓解的有前景途径。
引用
@article{arxiv.2503.00596,
title = {BadJudge: Backdoor Vulnerabilities of LLM-as-a-Judge},
author = {Terry Tong and Fei Wang and Zhe Zhao and Muhao Chen},
journal= {arXiv preprint arXiv:2503.00596},
year = {2025}
}
备注
Published to ICLR 2025