SEALGuard:面向大语言模型软件系统的东南亚语言多语言对话安全护栏
计算与语言
2025-07-18 v3 人工智能
摘要
安全对齐是大语言模型 (LLM) 驱动系统的关键环节。虽然近期的 LLM 护栏方法如 LlamaGuard 在检测以英语书写的不安全输入(例如“如何制造炸弹?”)时取得高准确率,但在多语言不安全输入检测方面仍存在不足。这一局限性使 LLM 系统暴露于以东南亚等低资源语言书写的不安全和越狱提示攻击。本文介绍 SEALGuard,一个针对多语言护栏设计的方案,旨在弥合现有护栏在多语言安全对齐方面的差距,确保 LLM 驱动系统有效过滤多语言不安全和越狱提示。我们采用低秩适配 (LoRA) 将通用多语言语言模型适配为多语言护栏。构建 SEALSBench,包含超过 26 万条十语言(包括安全、不安全和越狱案例)的大规模多语言安全对齐数据集。我们在该基准上评估了 SEALGuard 与最新护栏方法如 LlamaGuard 的表现。实验结果表明,多语言不安全和越狱提示显著降低了 LlamaGuard 的性能,其防御成功率 (DSR) 分别比仅使用英语提示时下降 9% 和 18%。相比之下,SEALGuard 在检测多语言不安全和越狱提示方面优于现有护栏,DSR 相比 LlamaGuard 提升 48%,并在 DSR、精确率和 F1 分数上取得最佳表现。我们的消融研究进一步揭示了适应策略和模型规模对 SEALGuard 总体性能的贡献。我们已在 https://github.com/awsm-research/SEALGuard 发布预训练模型和基准,以支持进一步研究。
引用
@article{arxiv.2507.08898,
title = {SEALGuard: Safeguarding the Multilingual Conversations in Southeast Asian Languages for LLM Software Systems},
author = {Wenliang Shan and Michael Fu and Rui Yang and Chakkrit Tantithamthavorn},
journal= {arXiv preprint arXiv:2507.08898},
year = {2025}
}