中文

定义、理解与检测在线有害内容:挑战与机器学习方法

计算与语言 2025-09-19 v1 机器学习 社会与信息网络

摘要

在线有害内容已演变为一种在危机、选举和社会动荡期间加剧的普遍现象。大量研究致力于使用机器学习方法检测或分析有害内容。跨数字平台的有害内容扩散已推动广泛研究自动检测机制,主要受益于机器学习和自然语言处理的进步。总体而言,本研究代表了对 140 篇关于数字平台不同类型有害内容研究的综合。我们提供了关于用于检测在线有害内容的数据集的全面概述,包括定义、数据来源、挑战以及各种机器学习方法,涵盖仇恨言论、冒犯语言和有害话语等。该数据集涵盖 32 种语言,覆盖选举、自发事件和危机等话题。我们考察了利用现有跨平台数据来提高分类模型性能的可能性。我们提出了针对在线有害内容检测和使用内容 moderation 进行缓解的建议与指南。最后,我们提出了缓解在线平台有害内容的实用指南。

关键词

引用

@article{arxiv.2509.14264,
  title  = {Defining, Understanding, and Detecting Online Toxicity: Challenges and Machine Learning Approaches},
  author = {Gautam Kishore Shahi and Tim A. Majchrzak},
  journal= {arXiv preprint arXiv:2509.14264},
  year   = {2025}
}

备注

Paper is accepted at LNCS Porceedings