中文

SafeWatch:一种高效安全策略遵循视频护栏模型,具透明解释

计算机视觉与模式识别 2024-12-11 v1 机器学习

摘要

随着生成式 AI 的兴起和高质量视频生成的快速增长,视频护栏已成为确保跨平台安全与安全性最关键的因素。然而,当前视频护栏要么过于简单,仅依赖于在简单政策上训练的纯分类模型,涉及有限的不安全类别,缺乏详细解释;要么使用包含长篇安全指南的多模态大语言模型(MLLM),不高效且不实用于护栏现实内容。为填补这一差距,我们提出 SafeWatch,这是一个高效的 MLLM-based video guardrail 模型,旨在遵循自定义安全政策并以 zero-shot manner 提供具备 content-specific explanations 的多标签视频护栏输出。具体而言,与传统 MLLM-based guardrails 不同,SafeWatch 独特地将每个政策块并行编码,消除其 position bias,使得所有政策 同时注意且权重相等。在此基础上,为提高效率与准确性,SafeWatch 融入 policy-aware visual token pruning 算法,自适应选择每个政策最相关的 video tokens,丢弃噪声或无关信息。这使得能够更聚焦、符合政策的护栏,显著降低计算开销。鉴于现有视频护栏基准的局限性,我们提出 SafeWatch-Bench,一个规模庞大的视频护栏基准,包含 超过 200 万个视频,涵盖 6 大安全类别,覆盖 30 多个任务,以确保对所有潜在安全情景的全面覆盖。SafeWatch 在 SafeWatch-Bench 上超越 SOTA 28.2%,在其他基准上提升 13.6%,成本降低 10%,并通过 LLM 与人类审阅验证其解释效果居于前列。

关键词

引用

@article{arxiv.2412.06878,
  title  = {SafeWatch: An Efficient Safety-Policy Following Video Guardrail Model with Transparent Explanations},
  author = {Zhaorun Chen and Francesco Pinto and Minzhou Pan and Bo Li},
  journal= {arXiv preprint arXiv:2412.06878},
  year   = {2024}
}

备注

43 pages, 20 figures