MART:通过多轮自动红队提升 LLM 安全性
计算与语言
2023-11-15 v1
摘要
红队测试是缓解大语言模型(LLMs)不安全行为的常见做法,包括彻底评估 LLM 以识别潜在缺陷,并通过负责任且准确的响应加以解决。虽然有效,但人工红队成本高昂,且现有自动红队通常仅发现安全风险而不加以解决。本文提出一种多轮自动红队(MART)方法,其结合了自动对抗提示撰写与安全响应生成,显著提升了红队可扩展性与目标 LLM 的安全性。具体而言,一个对抗性 LLM 与一个目标 LLM 以迭代方式相互作用,其中对抗性 LLM 旨在生成具有挑战性的提示以诱使目标 LLM 产生不安全响应,而目标 LLM 在这些对抗性提示上通过安全对齐数据进行微调。在每一轮中,对抗性 LLM 针对更新后的目标 LLM 构造更好的攻击,而目标 LLM 也通过安全微调自我改进。在对抗性提示基准上,经过 4 轮 MART 后,安全对齐有限的 LLM 的违规率降低高达 84.7%,达到与经过大量对抗性提示撰写的 LLM 相当的性能。值得注意的是,模型在非对抗性提示上的有用性在迭代过程中保持稳定,表明目标 LLM 在指令遵循上保持强劲性能。
引用
@article{arxiv.2311.07689,
title = {MART: Improving LLM Safety with Multi-round Automatic Red-Teaming},
author = {Suyu Ge and Chunting Zhou and Rui Hou and Madian Khabsa and Yi-Chia Wang and Qifan Wang and Jiawei Han and Yuning Mao},
journal= {arXiv preprint arXiv:2311.07689},
year = {2023}
}