中文

AdversariaLLM:面向LLM鲁棒性研究的统一模块化工具箱

人工智能 2025-11-07 v1 软件工程

摘要

大语言模型 (LLM) 安全与鲁棒性研究的快速扩张,导致实现、数据集和评估方法生态体系碎片化且常常存在错误。这种碎片化使得跨研究的可重复性和可比性性面临挑战,阻碍了有意义的进展。为此,我们引入AdversariaLLM,一个用于进行LLM越狱鲁棒性研究的工具箱。其设计以可重复性、正确性和可扩展性为核心。该框架实现了十二种对抗性攻击算法,集成了七个基准数据集,涵盖有害性、过度拒绝和实用性评估,并通过Hugging Face提供广泛的开源权重LLM访问。实现中包括计算资源跟踪、确定性结果以及分布式评估等高级特性,以保证可比性和可重复性。该工具还集成了通过伴随软件包JudgeZoo实现的评判功能,该软件包也可独立使用。这些组件共同旨在为LLM安全领域的透明、可比和可重复研究奠定坚实基础。

关键词

引用

@article{arxiv.2511.04316,
  title  = {AdversariaLLM: A Unified and Modular Toolbox for LLM Robustness Research},
  author = {Tim Beyer and Jonas Dornbusch and Jakob Steimle and Moritz Ladenburger and Leo Schwinn and Stephan Günnemann},
  journal= {arXiv preprint arXiv:2511.04316},
  year   = {2025}
}