中文

基于情感分析的全面跨语言有害内容检测框架

计算与语言 2024-03-05 v1

摘要

在当今数字时代,社交媒体在促进沟通和内容共享方面发挥着重要作用。然而,用户生成内容的指数级增长导致维持健康在线环境的挑战日益严峻。某些情况下,用户利用匿名性使用有害语言,这会负面影响用户体验并引发严重的社会问题。鉴于手动审核的局限性,人们开发了自动检测系统来应对这一问题。然而,仍存在若干障碍,包括缺乏对有害语言的通用定义、跨语言数据集不足、缺乏详细的标注指南,以及最重要的是缺乏综合性框架。本研究旨在通过引入首次提出的详细框架来解决这些挑战,该框架适用于任何语言。该框架涵盖了有害语言检测的各个方面。该框架的关键组件是开发通用且详细的标注指南。此外,整合情感分析代表了一种新颖的方法,用于增强有害语言检测。此外,本文提出了一种基于对不同相关概念审查得出的有害语言定义。为演示所提出框架的有效性,我们在一个具有挑战性的低资源语言中实现了该框架。我们收集了波斯语数据集,并应用标注指南进行有害检测和情感分析。随后,我们 presented baseline 实验,利用机器学习和深度学习方法建立基准。结果证明,该框架性能卓越,在冒犯语言检测中达到 99.4% 的准确率,在情感分析中达到 66.2% 的准确率。

关键词

引用

@article{arxiv.2403.01270,
  title  = {A comprehensive cross-language framework for harmful content detection with the aid of sentiment analysis},
  author = {Mohammad Dehghani},
  journal= {arXiv preprint arXiv:2403.01270},
  year   = {2024}
}