OmniGuard:面向全模态的统一安全护栏与深入推理
人工智能
2025-12-03 v1 计算与语言
密码学与安全
计算机视觉与模式识别
机器学习
摘要
处理文本、图像、视频和音频的全模态大语言模型(OLLMs)为人机交互中的安全与价值护栏带来新挑战。先前的护栏研究主要针对单模态场景,通常将安全检测框架化为二元分类,这限制了在多样化模态和任务上的鲁棒性。为此,我们提出OmniGuard——首个具备深入推理能力的全模态护栏家族,能够在所有模态上执行安全检测。为支持OmniGuard的训练,我们构建了规模庞大且结构完整的全模态安全数据集,包含21万余条多样化样本,输入涵盖单模态与跨模态样本。每个样本均标注结构化安全标签,并通过针对性蒸馏从专家模型中获取精心策划的安全评论。对15个基准进行大量实验表明,OmniGuard在广泛的多模态安全场景中实现了卓越的有效性与泛化能力。重要的是,OmniGuard提供了一个统一框架,能够在全模态范围内执行政策并缓解风险,为构建更加稳健且功能完善的全模态保护系统铺平了道路。
引用
@article{arxiv.2512.02306,
title = {OmniGuard: Unified Omni-Modal Guardrails with Deliberate Reasoning},
author = {Boyu Zhu and Xiaofei Wen and Wenjie Jacky Mo and Tinghui Zhu and Yanan Xie and Peng Qi and Muhao Chen},
journal= {arXiv preprint arXiv:2512.02306},
year = {2025}
}