中文

Aegis2.0:面向LLM Guardrails对齐的多样化AI安全数据集与风险分类学

计算与语言 2025-01-16 v1

摘要

随着大型语言模型(LLM)和生成式AI的广泛应用,内容安全问题也随之增长。目前,缺乏能够涵盖LLM相关安全风险全谱系并适用于商业应用的高质量、人工标注数据集。为弥合这一差距,我们提出了一套全面且可适配的风险分类学,将安全风险结构化分为12个顶层危险类别,并延伸为9个细分子类别。该分类学旨在满足下游用户的多样化需求,提供更细致和灵活的工具,以管理各种风险类型。我们采用混合数据生成管道,结合人工标注与多LLM“评议团”系统评估响应的安全性,从而获得Aegis 2.0——这是一个根据我们提出的分类学精心策划的34,248组人类-LLM交互样本集合。为验证其有效性,我们展示了若干轻量级模型在Aegis 2.0上使用参数高效技术训练后,能够与在更大规模、非商业数据集上完全微调的领先安全模型保持竞争力。此外,我们引入一种新型训练混合策略,将安全性与主题跟随数据相结合。这种方法增强了护卫模型的适应性,使其能够在推理期间定义的新风险类别上进行泛化。我们计划将Aegis 2.0数据和模型开源,以帮助研究社区为LLM提供安全护卫。

关键词

引用

@article{arxiv.2501.09004,
  title  = {Aegis2.0: A Diverse AI Safety Dataset and Risks Taxonomy for Alignment of LLM Guardrails},
  author = {Shaona Ghosh and Prasoon Varshney and Makesh Narsimhan Sreedhar and Aishwarya Padmakumar and Traian Rebedea and Jibin Rajan Varghese and Christopher Parisien},
  journal= {arXiv preprint arXiv:2501.09004},
  year   = {2025}
}

备注

arXiv admin note: text overlap with arXiv:2404.05993