中文

面向 LLM 基准测试的选择性对抗攻击

机器学习 2025-10-16 v1

摘要

基准测试结果越来越主导 LLM 的信任、选择和部署,但这些评估仍然容易受到语义等价对抗扰动的威胁。先前在 NLP 中对对抗鲁棒性的工作强调影响多模型的文本攻击,留下了是否存在可能在最小影响其他模型的情况下选择性降低或提升性能的问题。我们对此问题进行形式化建模,并研究了针对 MMLU - 这个旨在衡量语言模型广泛通用知识和推理能力的基准测试的选择性对抗攻击。通过集成到 TextAttack 框架中的标准攻击,我们引入了选择性评估协议,开发了自定义约束以增加攻击的选择性,并提出了一种替代 LLM 管道生成选择性扰动。经验上,我们发现选择性对抗攻击的确存在,并且可以实质性地改变相对排名,这挑战了以 leaderboard 驱动评估的公平性、可重复性和透明度。我们的结果激励了对 LLM 评估进行感知扰动报告和鲁棒性诊断,并表明即使是细微的编辑也能改变比较判断。

关键词

引用

@article{arxiv.2510.13570,
  title  = {Selective Adversarial Attacks on LLM Benchmarks},
  author = {Ivan Dubrovsky and Anastasia Orlova and Illarion Iov and Nina Gubina and Irena Gureeva and Alexey Zaytsev},
  journal= {arXiv preprint arXiv:2510.13570},
  year   = {2025}
}