中文

MrGuard: 通用 LLM 安全的多语言推理警戒系统

计算与语言 2025-09-29 v3

摘要

大型语言模型 (LLM) 易受对抗攻击如越狱攻击的威胁,这些攻击可能诱发有害或不安全的行为。这种脆弱性在多语言环境中尤为突出,因为多语言安全对齐数据通常有限。因此,开发一种能够跨多种语言检测和过滤不安全内容的警戒系统对于在实际应用中部署 LLM 至关重要。本文我们引入一种具有推理能力的多语言警戒系统,用于提示分类。该方法包括: (1) 包含文化和语言细微差异变体的合成多语言数据生成, (2) 监督式微调,以及 (3) 基于课程的 Group Relative Policy Optimization (GRPO) 框架进一步提升性能。实验结果表明,MrGuard 在多语言环境下的性能 consistently 超过最近的基线方法超过 15%。我们还评估了 MrGuard 对多语言变化的鲁棒性,如 code-switching 和提示中低资源语言干扰,并演示了在这些具有挑战性条件下仍能保持安全判断。该警戒系统的多语言推理能力使其能够生成解释,特别适用于理解多语言内容 moderation 中的语言特定风险和歧义。

关键词

引用

@article{arxiv.2504.15241,
  title  = {MrGuard: A Multilingual Reasoning Guardrail for Universal LLM Safety},
  author = {Yahan Yang and Soham Dan and Shuo Li and Dan Roth and Insup Lee},
  journal= {arXiv preprint arXiv:2504.15241},
  year   = {2025}
}

备注

Preprint