中文

LionGuard 2:构建轻量级、数据高效且本地化的多语言内容审核器

计算与语言 2025-09-30 v2 机器学习

摘要

现代审核系统越来越多地支持多种语言,但往往未能解决本地化和低资源变体的问题——这在实际部署中造成了安全漏洞。小型模型为大型LLM提供了一种潜在的替代方案,但仍然需要大量的数据和计算资源。我们提出了LionGuard 2,这是一个为新加坡语境定制的轻量级多语言审核分类器,支持英语、中文、马来语和部分泰米尔语。LionGuard 2基于预训练的OpenAI嵌入和多头有序分类器构建,在17个基准测试(包括新加坡特定数据集和公开英语数据集)上优于多个商业和开源系统。该系统已在新加坡政府内部积极部署,展示了大规模实际应用的有效性。我们的研究结果表明,高质量的本土数据和稳健的多语言嵌入可以在无需微调大型模型的情况下实现强大的审核性能。我们发布模型权重和部分训练数据,以支持未来在LLM安全方面的工作。

关键词

引用

@article{arxiv.2507.15339,
  title  = {LionGuard 2: Building Lightweight, Data-Efficient & Localised Multilingual Content Moderators},
  author = {Leanne Tan and Gabriel Chua and Ziyu Ge and Roy Ka-Wei Lee},
  journal= {arXiv preprint arXiv:2507.15339},
  year   = {2025}
}

备注

EMNLP 2025 System Demonstration Track