中文

面向更安全社交媒体平台的大语言模型可扩展且高效的少样本有害内容审核

计算与语言 2025-01-27 v1 人工智能 计算机与社会 社会与信息网络

摘要

社交媒体平台上有害内容的流行对用户和社会构成重大风险,迫切需要更有效且可扩展的内容审核策略。当前方法依赖人工审核员、监督式分类器和大量训练数据,往往在可扩展性、主观性以及有害内容(如暴力内容、危险挑战趋势等)的动态性方面方寸未用。为弥合这一差距,我们利用大语言模型(LLM)通过零样本和少样本学习进行动态内容审核。通过在多个大语言模型上的大量实验,我们证明了我们的少样本方法在识别有害内容方面优于现有专有基线(Perspective 和 OpenAI Moderation)以及先前的最先进的少样本学习方法。我们还整合了视觉信息(视频缩略图),评估不同的多模态技术是否提高模型性能。我们的结果凸显了采用 LLM 方法进行在线可扩展和动态有害内容审核的显著优势。

关键词

引用

@article{arxiv.2501.13976,
  title  = {Towards Safer Social Media Platforms: Scalable and Performant Few-Shot Harmful Content Moderation Using Large Language Models},
  author = {Akash Bonagiri and Lucen Li and Rajvardhan Oak and Zeerak Babar and Magdalena Wojcieszak and Anshuman Chhabra},
  journal= {arXiv preprint arXiv:2501.13976},
  year   = {2025}
}

备注

This paper is in submission and under peer review