中文

免费毒性检测

计算与语言 2024-11-11 v2

摘要

当前的 LLM 通常经过对齐以遵循安全要求,并倾向于拒绝有毒提示。然而,LLM 可能无法拒绝有毒提示,或者过于谨慎而拒绝良性示例。此外,最先进的毒性检测器在低假阳性率下具有低真阳性率,在现实世界中毒性示例稀少的情况下会产生高成本。本文介绍了 MULI(使用 LLM 内省进行审核),它利用直接从 LLM 本身提取的信息来检测有毒提示。我们发现可以从第一个响应令牌 logits 的分布中区分良性和有毒提示。利用这个想法,我们在第一个响应令牌 logits 上使用稀疏逻辑回归模型构建了一个鲁棒的有毒提示检测器。我们的方案在多个指标上优于最先进的检测器。

关键词

引用

@article{arxiv.2405.18822,
  title  = {Toxicity Detection for Free},
  author = {Zhanhao Hu and Julien Piet and Geng Zhao and Jiantao Jiao and David Wagner},
  journal= {arXiv preprint arXiv:2405.18822},
  year   = {2024}
}

备注

Accepted by Neurips 2024