免费毒性检测
计算与语言
2024-11-11 v2
摘要
当前的 LLM 通常经过对齐以遵循安全要求,并倾向于拒绝有毒提示。然而,LLM 可能无法拒绝有毒提示,或者过于谨慎而拒绝良性示例。此外,最先进的毒性检测器在低假阳性率下具有低真阳性率,在现实世界中毒性示例稀少的情况下会产生高成本。本文介绍了 MULI(使用 LLM 内省进行审核),它利用直接从 LLM 本身提取的信息来检测有毒提示。我们发现可以从第一个响应令牌 logits 的分布中区分良性和有毒提示。利用这个想法,我们在第一个响应令牌 logits 上使用稀疏逻辑回归模型构建了一个鲁棒的有毒提示检测器。我们的方案在多个指标上优于最先进的检测器。
引用
@article{arxiv.2405.18822,
title = {Toxicity Detection for Free},
author = {Zhanhao Hu and Julien Piet and Geng Zhao and Jiantao Jiao and David Wagner},
journal= {arXiv preprint arXiv:2405.18822},
year = {2024}
}
备注
Accepted by Neurips 2024