中文

DiveR-CT: 通过放宽约束增强多样性的红队测试大型语言模型助手

机器学习 2024-12-23 v2 人工智能 计算与语言 密码学与安全

摘要

近期大型语言模型助手的进步使其变得不可或缺,引发了对其安全管理的重大担忧。自动化红队测试为劳动密集且易出错的手动漏洞探测提供了一种有前景的替代方案,提供更一致和可扩展的安全评估。然而,现有方法通常通过最大化攻击成功率来牺牲多样性。此外,使用语义多样性奖励降低历史嵌入余弦相似度的方法会导致随着历史增长而新颖性停滞。为了解决这些问题,我们引入了DiveR-CT,它放宽了对目标和语义奖励的常规约束,赋予策略更大的自由度以增强多样性。我们的实验表明,DiveR-CT在以下方面显著优于基线:1)生成的数据在不同攻击成功率水平下在各种多样性指标上表现更好;2)通过基于收集数据的安全调优更好地增强蓝队模型的弹性;3)允许动态控制目标权重以实现可靠且可控的攻击成功率;4)减少对奖励过度优化的敏感性。总体而言,我们的方法为LLM红队测试提供了一种有效且高效的方法,加速了实际部署。

关键词

引用

@article{arxiv.2405.19026,
  title  = {DiveR-CT: Diversity-enhanced Red Teaming Large Language Model Assistants with Relaxing Constraints},
  author = {Andrew Zhao and Quentin Xu and Matthieu Lin and Shenzhi Wang and Yong-jin Liu and Zilong Zheng and Gao Huang},
  journal= {arXiv preprint arXiv:2405.19026},
  year   = {2024}
}

备注

Accepted by the 39th Annual AAAI Conference on Artificial Intelligence (AAAI-25)