面向 LLM 评审系统的改写对抗攻击
计算与语言
2026-01-13 v1 人工智能
机器学习
摘要
大语言模型(LLM)在同行评审系统中的应用正在引起日益关注,这需要考察其潜在漏洞。先前的攻击依赖于提示注入,这会改变手稿内容并将注入灵敏性与评估鲁棒性混为一谈。我们提出了改写对抗攻击(Paraphrasing Adversarial Attack, PAA),这是一种黑箱优化方法,搜索能获得更高评审分数的改写序列,同时保持语义等价性和语言自然性。PAA 利用基于情境的学习,利用之前的改写及其分数来指导候选生成。在三个 LLM 评审和五个攻击模型跨五个机器学习和自然语言处理会议的实验中,PAA 均能在不改变论文声明的前提下持续提高评审分数。人类评估确认,生成的改写保持原意和自然性。我们还发现,受攻击的论文在评审中的平均不确定性得分升高,这提供了潜在的检测信号,改写提交也能部分缓解此类攻击。
引用
@article{arxiv.2601.06884,
title = {Paraphrasing Adversarial Attack on LLM-as-a-Reviewer},
author = {Masahiro Kaneko},
journal= {arXiv preprint arXiv:2601.06884},
year = {2026}
}