中文

面向 TikTok 的冒犯性内容检测建模

计算与语言 2024-10-21 v2

摘要

社交媒体的出现改变了人际沟通和信息消费过程。这一数字环境迎合了用户意图,同时也导致了冒犯性语言和有害行为的增加。与此同时,社交媒体平台收集了包含用户生成内容和行为信息的海量数据集。这些数据集对于部署机器学习和数据驱动策略的平台至关重要,有助于获取客户洞察并制定针对虚假信息和冒犯性内容等社会操纵机制的反制措施。然而,研究人员和从业者能够获取此类数据集以及应用各种机器学习技术,针对特定社交媒体平台上的特定事件进行研究的能力是有限的。特别是对于提供独特个性化内容创作和分享工具的 TikTok 而言,现有知识体系将受益于拥有多样化的综合性数据集及针对冒犯性内容的相关数据分析解决方案。尽管社交媒体平台、研究界和从业者社区在此方面做出了努力,此类内容仍在不断扩散。这意味着公开数据集并构建相应的智能解决方案存在迫切需求。为此,本研究收集并分析了包含冒犯性内容的 TikTok 数据,构建了一系列用于冒犯性内容检测的机器学习和深度学习模型。此举旨在回答以下研究问题:“如何开发一系列计算模型来检测 TikTok 上的冒犯性内容?”。为此,我们采用了数据科学方法论,收集了 120,423 条 TikTok 评论,并在平衡的二分类方法上获得了 0.863 的 F1 score 性能结果。

关键词

引用

@article{arxiv.2408.16857,
  title  = {Modeling offensive content detection for TikTok},
  author = {Kasper Cools and Gideon Mailette de Buy Wenniger and Clara Maathuis},
  journal= {arXiv preprint arXiv:2408.16857},
  year   = {2024}
}

备注

Accepted as a conference paper at DPSH 2024, 8 pages