RedRFT:基于强化微调的红队测试轻量基准
机器学习
2025-06-06 v1
摘要
红队测试已被证明是识别和缓解大语言模型(LLM)漏洞的有效方法。强化微调(RFT)已成为现有红队测试技术中有前景的策略。然而,缺乏统一的基准阻碍了当前的基于RFT的红队测试方法。实现细节,尤其是基于近端策略优化(PPO)的RFT,显著影响结果的稳定性和可重复性。为了解决这个问题,我们引入了RedRFT,一个轻量级基准,旨在简化和标准化基于RFT的红队测试的实现和评估。RedRFT结合了单文件CleanRL和高度模块化Tianshou的设计优势,提供了高质量的单文件红队测试实现和模块化的PPO核心组件,如广义优势估计器。它支持多种token和句子多样性度量,具有模块化的内在奖励计算功能,便于即插即用实验。为了阐明它们对RFT性能的影响,我们对关键组件进行了广泛的消融研究,包括低秩适应(LoRA)、Kullback-Leibler(KL)散度和拉格朗日乘子。我们希望这项工作有助于1)全面理解基于RFT的红队测试算法的实现细节,以及2)实现基于RFT的红队测试创新功能的快速原型开发。该基准的代码可在 https://github.com/x-zheng16/RedRFT.git 获取。
引用
@article{arxiv.2506.04302,
title = {RedRFT: A Light-Weight Benchmark for Reinforcement Fine-Tuning-Based Red Teaming},
author = {Xiang Zheng and Xingjun Ma and Wei-Bin Lee and Cong Wang},
journal= {arXiv preprint arXiv:2506.04302},
year = {2025}
}