中文

ORFuzz:对抗LLM安全的“另一侧”进行模糊测试——测试超出拒绝

软件工程 2026-05-05 v2 人工智能 计算与语言 信息检索

摘要

大型语言模型(LLM)日益表现出过度拒绝——因保护措施过于保守而错误地拒绝善意查询,这是一个严重的功能性缺陷,削弱了其可靠性和可用性。当前用于测试这一行为的方法明显不足,存在 flawed benchmarks和有限的测试生成能力,正如我们通过实证用户研究所揭示的那样。本文引入首个演化测试框架ORFuzz,用于系统检测和分析LLM的过度拒绝。ORFuzz独特地集成了三个核心组件:(1) 针对安全类别的种子选择以实现全面的测试覆盖;(2) 使用推理LLM进行自适应变异器优化以生成有效的测试用例;(3) OR-Judge,一个经过验证的人类对齐评判模型,能够准确反映用户对有害性和拒绝的感知。我们的广泛评估表明,ORFuzz以超过两倍的生成率(平均6.98%)产生多样且经验证的过度拒绝实例,有效地揭示了漏洞。此外,ORFuzz的输出构成ORFuzzSet的基础,这是一个包含1,855个高度可迁移测试用例的新基准数据集,在10个多样化LLM上的平均过度拒绝率达到优异的63.56%,显著优于现有数据集。ORFuzz和ORFuzzSet为开发更可靠和可信赖的基于LLM的软件系统提供了稳健的自动化测试框架和宝贵的社区资源。

关键词

引用

@article{arxiv.2508.11222,
  title  = {ORFuzz: Fuzzing the "Other Side" of LLM Safety -- Testing Over-Refusal},
  author = {Haonan Zhang and Dongxia Wang and Yi Liu and Kexin Chen and Jiashui Wang and Xinlei Ying and Long Liu and Wenhai Wang},
  journal= {arXiv preprint arXiv:2508.11222},
  year   = {2026}
}

备注

Accepted by ASE 2025