KidsNanny:面向儿童安全的内容审核双阶段多模态管线
计算机视觉与模式识别
2026-03-18 v1 密码学与安全
摘要
我们提出 KidsNanny,一个面向儿童安全的内容审核双阶段多模态架构。阶段 1 将视觉变换器 (ViT) 与目标检测器组合进行视觉筛选(耗时 11.7 毫秒);输出被路由至阶段 2,该阶段应用 OCR 和基于文本的 7B 大语言模型进行情境推理(总体管线耗时 120 毫秒)。我们在 UnsafeBench 性感类别(1,054 张图片)上进行评估,分为两种方案:视觉专用模式(仅评估阶段 1)和多模态模式(评估完整的阶段 1+2 管线)。阶段 1 在 11.7 毫秒下实现 80.27% 的准确率和 85.39% 的 F1 分数;视觉专用基线的准确率范围为 59.01%至 77.04%。完整管线在 120 毫秒下实现 81.40% 的准确率和 86.16% 的 F1 分数,分别与 ShieldGemma-2(64.80% 准确率,1,136 毫秒)和 LlavaGuard(80.36% 准确率,4,138 毫秒)进行比较。为评估文本感知能力,我们筛选了两个子集:文本+视觉子集(257 张图片)和文本专用子集(44 张图片,安全性主要依赖嵌入文本)。在文本专用图片上,KidsNanny 实现 100% 的召回率(25/25 阳性;样本量较小)和 75.76% 的精确率;ShieldGemma-2 在 1,136 毫秒下实现 84% 的召回率和 60% 的精确率。结果表明,专门的 OCR 基于推理方法在低延迟下对文本嵌入威胁可能实现召回率-精确率优势,尽管文本专用子集较小限制了可泛化性。通过记录该架构和评估方法,我们旨在为更广泛的研究工作贡献力量,即高效的多模态儿童内容审核。
引用
@article{arxiv.2603.16181,
title = {KidsNanny: A Two-Stage Multimodal Content Moderation Pipeline Integrating Visual Classification, Object Detection, OCR, and Contextual Reasoning for Child Safety},
author = {Viraj Panchal and Tanmay Talsaniya and Parag Patel and Meet Patel},
journal= {arXiv preprint arXiv:2603.16181},
year = {2026}
}
备注
12 pages, 2 figures, 6 tables