LLM作为评判者是否稳健?探究零样本LLM评估的通用对抗攻击
计算与语言
2024-07-08 v2
摘要
大型语言模型(LLM)是强大的零样本评估器,用于实际场景,如评估笔试和基准测试系统。尽管有这些关键应用,但尚无现有工作分析评判型LLM对对抗性操纵的脆弱性。本文首次研究了评估型LLM的对抗鲁棒性,我们证明短小的通用对抗短语可以拼接起来欺骗评判型LLM,使其预测虚高的分数。由于对手可能不知道或无法访问评判型LLM,我们提出了一种简单的替代攻击:首先攻击替代模型,然后将学到的攻击短语转移到未知的评判型LLM。我们提出了一种实用算法来确定短小的通用攻击短语,并证明当转移到未见过的模型时,分数可以被大幅抬高,以至于无论评估的文本是什么,都会预测出最高分。研究发现,当用于绝对评分(而非比较评估)时,评判型LLM对这些对抗攻击明显更易受影响。我们的发现引发了对LLM作为评判者方法可靠性的担忧,并强调了在将LLM评估方法部署到高风险现实场景之前解决其脆弱性的重要性。
引用
@article{arxiv.2402.14016,
title = {Is LLM-as-a-Judge Robust? Investigating Universal Adversarial Attacks on Zero-shot LLM Assessment},
author = {Vyas Raina and Adian Liusie and Mark Gales},
journal= {arXiv preprint arXiv:2402.14016},
year = {2024}
}