中文

基于机器学习的在线滥用语言综合分类法研究

计算与语言 2025-04-25 v1

摘要

在线交流中滥用语言的泛滥对个人和社区的健康与福祉构成了重大风险。人们对网络滥用及其后果日益关注,这 necessitates 识别和减轻有害内容并促进持续监控、审核和早期干预的方法。本文提出了一个分类法,用于区分在线文本中滥用语言的关键特征。我们的方法采用系统化的分类法开发流程,整合了 18 个现有多标签数据集的分类系统,以捕获与在线滥用语言分类相关的关键特征。所得分类法是分层且分面的,包含 5 个类别和 17 个维度。它对网络滥用的各个方面进行了分类,包括滥用的语境、目标、强度、直接性和主题。这种共识可以促成更凝聚的努力,促进知识交流,并加速研究人员、政策制定者、在线平台所有者及其他利益相关者在网络滥用检测与缓解领域的进展。

关键词

引用

@article{arxiv.2504.17653,
  title  = {Towards a comprehensive taxonomy of online abusive language informed by machine leaning},
  author = {Samaneh Hosseini Moghaddam and Kelly Lyons and Cheryl Regehr and Vivek Goel and Kaitlyn Regehr},
  journal= {arXiv preprint arXiv:2504.17653},
  year   = {2025}
}