中文

逆向宪法 AI:基于概率夹切 RLAIF 的可控有毒数据生成框架

计算与语言 2026-04-21 v1 人工智能

摘要

确保大语言模型(LLM)的安全性需要稳健的红队测试,但系统性合成高质量有毒数据的工作仍属未充分探索的领域。我们提出逆向宪法 AI(Reverse Constitutional AI, 简称 R-CAI),一种用于自动化和可控对抗数据生成的框架,超越孤立的越狱提示。通过将无害宪法倒转为有毒宪法,并通过批判-修订管道迭代细化模型输出,R-CAI 能够在无需人工标注的情况下生成可扩展的多维对抗数据。然而,仅为与毒性相关的奖励进行优化会导致奖励攻击和语义连贯性下降。为解决此挑战,我们在强化学习从 AI 反馈中引入概率夹切,该方法在保持对抗性意图的同时稳定了对抗优化。实验表明,R-CAI 能够生成多样化的高质量有毒数据,概率夹切在不牺牲对抗性强度的前提下显著提升了语义连贯性(提升 15%)。总体而言,R-CAI 提供了一个完全自动化的红队数据生成框架,用于对齐后语言模型的系统性安全评估。

关键词

引用

@article{arxiv.2604.17769,
  title  = {Reverse Constitutional AI: A Framework for Controllable Toxic Data Generation via Probability-Clamped RLAIF},
  author = {Yuan Fang and Yiming Luo and Aimin Zhou and Fei Tan},
  journal= {arXiv preprint arXiv:2604.17769},
  year   = {2026}
}

备注

Accepted to Findings of ACL 2026. 10 pages, 6 figures. Code and data available at https://github.com/ZeroLoss-Lab/R-CAI