ShieldLM:赋能大语言模型成为对齐、可定制且可解释的安全检测器
计算与语言
2024-11-06 v2
摘要
大语言模型(LLM)的安全性近年来受到越来越多的关注,但仍缺乏一种全面的方法,能够以对齐、可定制且可解释的方式检测 LLM 响应中的安全问题。在本文中,我们提出了 ShieldLM,一种基于 LLM 的安全检测器,它符合通用安全标准,支持可定制的检测规则,并为其决策提供解释。为了训练 ShieldLM,我们编译了一个包含 14,387 个查询 - 响应对的大型双语数据集,并根据各种安全标准对响应的安全性进行了标注。通过大量实验,我们证明 ShieldLM 在四个测试集上超越了强大的基线模型,展现了卓越的可定制性和可解释性。除了在标准检测数据集上表现良好外,ShieldLM 还被证明可作为先进 LLM 的安全评估器。ShieldLM 已在 \url{https://github.com/thu-coai/ShieldLM} 发布,以支持在各种安全标准下进行准确且可解释的安全检测。
引用
@article{arxiv.2402.16444,
title = {ShieldLM: Empowering LLMs as Aligned, Customizable and Explainable Safety Detectors},
author = {Zhexin Zhang and Yida Lu and Jingyuan Ma and Di Zhang and Rui Li and Pei Ke and Hao Sun and Lei Sha and Zhifang Sui and Hongning Wang and Minlie Huang},
journal= {arXiv preprint arXiv:2402.16444},
year = {2024}
}
备注
19 pages. Camera ready version of EMNLP 2024 Findings