中文

TRIDENT:通过三维多样化红队数据合成增强大型语言模型安全性

计算与语言 2026-04-20 v2

摘要

大型语言模型(LLM)在各类自然语言处理任务中表现出色,但仍然容易生成有害内容或被滥用于恶意目的。尽管已引入安全对齐数据集以通过监督微调(SFT)来缓解此类风险,但这些数据集通常缺乏全面的风险覆盖。大多数现有数据集主要关注词汇多样性,而忽略了其他关键维度。为了解决这一局限性,我们提出了一个新颖的分析框架,用于从三个基本维度系统地衡量对齐数据集的风险覆盖:词汇多样性、恶意意图和越狱策略。我们进一步引入了 TRIDENT,这是一个自动化流水线,利用基于角色设定的零样本 LLM 生成来产生跨越这些维度的多样化且全面的指令。每条有害指令都配有一个符合伦理的对齐响应,从而生成两个数据集:包含 26,311 个示例的 TRIDENT-Core 和包含 18,773 个示例的 TRIDENT-Edge。在 TRIDENT-Edge 上对 Llama 3.1-8B 进行微调展示了实质性的改进,与在 WildBreak 数据集上微调的性能最佳的基线模型相比,其 Harm Score 平均降低了 14.29%,Attack Success Rate 降低了 20%。

关键词

引用

@article{arxiv.2505.24672,
  title  = {TRIDENT: Enhancing Large Language Model Safety with Tri-Dimensional Diversified Red-Teaming Data Synthesis},
  author = {Xiaorui Wu and Xiaofeng Mao and Fei Li and Xin Zhang and Xuanhong Li and Chong Teng and Donghong Ji and Zhuang Li},
  journal= {arXiv preprint arXiv:2505.24672},
  year   = {2026}
}