中文

SafeLens:基于快速-慢速筛选的高效视频护栏

计算机视觉与模式识别 2026-05-19 v1 计算与语言

摘要

在线视频平台的快速增长和 AI 生成内容的普及,使可靠的视频护栏成为安全和实际部署的关键挑战。虽然大多数视频可通过快速模式识别进行筛选,但小部分需要对复杂的时序内容和细致的政策约束进行深层推理。现有方法通常依赖于在所有输入上统一应用大型视觉-语言模型,导致高推理成本和不高效的计算资源分配。我们提出SafeLens,一种视频护栏框架,引入快速-慢速推理架构,实现高效且准确的内容 moderation,不同输入的计算成本各不相同。此外,我们通过对 SafeWatch 数据集应用影响引导过滤,构建高质量数据集,仅保留原始数据的 2.4%。为进一步解决训练时扩张的局限性,我们通过增强筛选后数据集的结构化链路思考 (Chain-of-Thought) 痕迹来实现测试时推理。在实际场景和 AI 生成视频基准测试中,SafeLens 实现了最先进的性能,超越了强大的开源视频护栏(如 SafeWatch-8B、OmniGuard-7B)和闭源模型(如 GPT-5.4、Gemini-3.1-pro),同时显著降低推理成本,表明高效设计不仅比单纯扩大数据或模型规模更有效。

关键词

引用

@article{arxiv.2605.17610,
  title  = {SafeLens: Deliberate and Efficient Video Guardrails with Fast-and-Slow Screening},
  author = {Shahriar Kabir Nahin and Hadi Askari and Muhao Chen and Anshuman Chhabra},
  journal= {arXiv preprint arXiv:2605.17610},
  year   = {2026}
}