中文

AI 与人类Moderator:多模态 LLM 在品牌安全内容审核中的比较评估

计算机视觉与模式识别 2025-12-30 v2

摘要

随着在线视频内容呈指数级增长,对不安全视频的审核需求已超越人类的能力,给运营和心理健康带来了挑战。虽然最近的研究表明了多模态大语言模型(MLLM)在各种视频理解任务中的优势,但其在需要精细理解视觉和文本线索的多模态内容审核领域的应用仍相对不足。在本工作中,我们对 MLLMs 在品牌安全分类方面的能力进行基准测试,该分类是保障广告完整性的内容审核的关键子领域。为此,我们引入了一个新型、多模态且多语言的数据集,该数据集由专业审核人员在多种风险类别中进行细致标注。通过详细的比较分析,我们展示了 MLLMs 如 Gemini、GPT 和 Llama 在多模态品牌安全方面的有效性,并评估了其准确率和成本效率与专业人类审核人员的对比。此外,我们present了深入讨论,阐明了 MLLMs 的局限性和失效案例。我们随本论文一并发布数据集,以促进未来在有效且负责任的品牌安全和内容审核方面的研究。

关键词

引用

@article{arxiv.2508.05526,
  title  = {When Deepfake Detection Meets Graph Neural Network:a Unified and Lightweight Learning Framework},
  author = {Haoyu Liu and Chaoyu Gong and Mengke He and Jiate Li and Kai Han and Siqiang Luo},
  journal= {arXiv preprint arXiv:2508.05526},
  year   = {2025}
}

备注

Accepted to KDD 2026