AEGIS:基于LLM专家集成的在线自适应AI内容安全审核
机器学习
2024-09-12 v2 计算与语言
计算机与社会
摘要
随着大型语言模型(LLMs)和生成式AI的普及,与其使用相关的内容安全风险也在增加。我们发现,在全面覆盖广泛关键安全领域的高质量内容安全数据集和基准方面存在明显不足。为了解决这个问题,我们定义了一个广泛的内容安全风险分类,包括13个关键风险和9个稀疏风险类别。此外,我们整理了AEGISSAFETYDATASET,一个包含约26,000个人类-LLM交互实例的新数据集,并附有遵循该分类的人工标注。我们计划向社区发布该数据集,以促进研究并帮助对LLM模型进行安全基准测试。为了展示数据集的有效性,我们对多个基于LLM的安全模型进行了指令微调。我们表明,我们的模型(称为AEGISSAFETYEXPERTS)不仅超越或与最先进的基于LLM的安全模型和通用LLM性能相当,而且在多个越狱攻击类别中表现出鲁棒性。我们还展示了在LLM对齐阶段使用AEGISSAFETYDATASET不会对对齐模型在MT Bench分数上的性能产生负面影响。此外,我们提出了AEGIS,一种具有强理论保证的无遗憾在线自适应框架的新应用,用于在部署中使用LLM内容安全专家集成进行内容审核。
引用
@article{arxiv.2404.05993,
title = {AEGIS: Online Adaptive AI Content Safety Moderation with Ensemble of LLM Experts},
author = {Shaona Ghosh and Prasoon Varshney and Erick Galinkin and Christopher Parisien},
journal= {arXiv preprint arXiv:2404.05993},
year = {2024}
}