中文

LionGuard:构建面向本地化不安全内容的情境化 moderation 分类器

计算与语言 2024-07-22 v2 人工智能

摘要

随着大型语言模型 (LLM) 在广泛应用场景中变得日益普及,关于其输出安全性的关注度也随之升高。当前大多数安全调优或 moderation 工作都带有以西方为主的安全观,尤其是对于有毒、仇恨或暴力言论。本文描述了 LionGuard——一个新加坡情境化的 moderation 分类器,可作为不安全 LLM 输出的 guardrail。在 Singlish 数据上评估时,LionGuard 比那些未针对新加坡情境进行微调的广泛使用的 moderation API 在二分类(binary)上高出 14%,在多标签分类(multi-label)上高出最高 51%。我们的工作凸显了 localization 对 moderation 分类器的优势,并提出了一种实用且可扩展的低资源语言方法。

关键词

引用

@article{arxiv.2407.10995,
  title  = {LionGuard: Building a Contextualized Moderation Classifier to Tackle Localized Unsafe Content},
  author = {Jessica Foo and Shaun Khoo},
  journal= {arXiv preprint arXiv:2407.10995},
  year   = {2024}
}

备注

Preprint