社交媒体中的敏感内容分类:综合资源与评估
计算与语言
2025-06-25 v3
摘要
检测大数据中的敏感内容对于确保共享和分析的数据-free于有害材料至关重要。然而,当前的 moderation工具,如外部 API,存在定制性差、跨多样化敏感类别准确性差以及隐私问题等局限。此外,现有数据集和开源模型主要聚焦于有毒语言,缺乏对其他敏感类别(如物质滥用或自伤)的检测。本文提出了一个针对社交媒体内容 moderation 的统一数据集,涵盖六类敏感内容:冲突语言、粗口、性显露内容、毒品相关内容、自伤和垃圾信息。通过一致的检索策略和指南进行数据收集和标注,我们解决了以往专注研究的不足。我们的分析表明,对该新数据集进行 fine-tuning 的大型语言模型(LLM)在检测性能上显著优于开源模型如 LLaMA,即使是专有 OpenAI 模型也低于我们方法 10-15%。这种局限在流行 moderation API 中更为明显,这些 API 难以针对特定敏感内容类别进行定制。
引用
@article{arxiv.2411.19832,
title = {Sensitive Content Classification in Social Media: A Holistic Resource and Evaluation},
author = {Dimosthenis Antypas and Indira Sen and Carla Perez-Almendros and Jose Camacho-Collados and Francesco Barbieri},
journal= {arXiv preprint arXiv:2411.19832},
year = {2025}
}
备注
Accepted at the 9th Workshop on Online Abuse and Harms (WOAH)