中文

内容审查:评估大型语言模型在文本、图像与视频中检测敏感内容的能力

计算机视觉与模式识别 2024-11-27 v1 人工智能

摘要

仇恨言语、骚扰、有害和性内容以及暴力内容在网站和媒体平台上的广泛传播 presents substantial 挑战,并引发社会各界的广泛关注。政府、教育者和家长常常与媒体平台在如何监管、控制和限制此类内容的传播方面存在分歧。用于检测和审查媒体内容的技术是解决这些挑战的关键方法。自然语言处理和计算机视觉技术已被广泛用于自动识别和过滤文本、图像和视频中的有害语言、暴力、裸露和成瘾内容,使平台能够按比例执行内容政策。然而,现有方法在实现高检测准确率、降低误报和漏报方面仍存在局限。因此,更精细的算法以理解文本和图像的上下文 may 为内容审查的构建更有效的系统提供新的机遇。本文评估了诸如 OpenAI moderation model 和 Llama-Guard3 等现有基于大型语言模型的内容审查解决方案,并研究其检测敏感内容的能力。此外,我们探索了近期的大型语言模型(如 GPT、Gemini 和 Llama)在识别不当内容方面的能力。various 文本和视觉数据集(如 X 条推文、Amazon 评论、新闻文章、人类照片、漫画、手绘和暴力视频)被用于评估和比较。结果表明,大型语言模型在检测准确率、误报和漏报率方面优于传统技术。这突显了将大型语言模型集成到网站、社交媒体平台和视频分享服务中的监管和内容审查潜力。

关键词

引用

@article{arxiv.2411.17123,
  title  = {Advancing Content Moderation: Evaluating Large Language Models for Detecting Sensitive Content Across Text, Images, and Videos},
  author = {Nouar AlDahoul and Myles Joshua Toledo Tan and Harishwar Reddy Kasireddy and Yasir Zaki},
  journal= {arXiv preprint arXiv:2411.17123},
  year   = {2024}
}

备注

55 pages, 16 figures