通过合成数据和 RL 指导的对抗训练实现轻量级安全护栏
机器学习
2025-07-14 v1 人工智能
计算与语言
摘要
我们提出一种轻量且高度有效的语言模型安全护栏框架,展示了小规模语言模型在内容审查任务中能够实现,甚至超过大型模型的性能。这通过高保真合成数据生成和对抗训练实现。合成数据生成过程从人类策划的种子数据开始,该数据经过查询增强和改写,以创建多样且上下文丰富的示例。随后对该增强数据进行多轮筛选,确保高保真度和相关性。灵感来自最近在生成对抗网络 (GAN) 架构方面的进展,我们的对抗训练采用强化学习指导生成器产生具挑战性的合成示例。这些示例用于微调安全分类器,以增强其检测和缓解有害内容的能力。此外,我们还整合了最近研究的高效 LLM 训练策略,利用小型模型的能力来提高大型生成模型的性能。通过迭代对抗训练和生成多样化、高质量合成数据,我们的框架使小型语言模型 (SLM) 能够作为强大的安全护栏。该方法不仅降低了计算开销,还增强了对对抗攻击的韧性,为 AI 系统中的内容审查提供了可扩展且高效的解决方案。
引用
@article{arxiv.2507.08284,
title = {Lightweight Safety Guardrails via Synthetic Data and RL-guided Adversarial Training},
author = {Aleksei Ilin and Gor Matevosyan and Xueying Ma and Vladimir Eremin and Suhaa Dada and Muqun Li and Riyaaz Shaik and Haluk Noyan Tokgozoglu},
journal= {arXiv preprint arXiv:2507.08284},
year = {2025}
}