OMNIGUARD:一种跨语言与模态的高效 AI 安全审查方法
计算与语言
2025-12-10 v2 人工智能
人机交互
机器学习
摘要
大型语言模型(LLM)涌现的能力引发了人们对其被直接滥用于有害目的的担忧。缓解这些担忧的核心方法是检测针对模型的有害查询。当前的检测方法存在缺陷,尤其容易受到利用模型能力泛化不匹配的攻击(例如,低资源语言的提示词或以图像和音频等非文本模态提供的提示词)。为了应对这一挑战,我们提出了 Omniguard,一种跨语言和模态检测有害提示词的方法。我们的方法 识别 LLM/MLLM 中跨语言或模态对齐的内部表示,然后 利用它们构建一个与语言无关或与模态无关的分类器来检测有害提示词。在多语言设置中,Omniguard 将有害提示词分类准确率比最强基线提高了 11.57%,在基于图像的提示词上提高了 20.44%,并为基于音频的提示词设定了新的 SOTA。通过重新利用生成过程中计算的嵌入,Omniguard 还非常高效(比次快基线快约 )。代码和数据可在以下地址获取:https://github.com/vsahil/OmniGuard。
引用
@article{arxiv.2505.23856,
title = {OMNIGUARD: An Efficient Approach for AI Safety Moderation Across Languages and Modalities},
author = {Sahil Verma and Keegan Hines and Jeff Bilmes and Charlotte Siska and Luke Zettlemoyer and Hila Gonen and Chandan Singh},
journal= {arXiv preprint arXiv:2505.23856},
year = {2025}
}