中文

HateGPT:释放 GPT-3.5 Turbo 以打击 X 平台上的仇恨言论

计算与语言 2025-03-26 v3

摘要

Twitter 和 Facebook 等社交媒体平台的广泛使用使各个年龄段的人都能分享他们的想法和经历,导致用户生成内容的大量积累。然而,在带来益处的同时,这些平台也面临着管理仇恨言论和攻击性内容的挑战,这可能会破坏理性话语并威胁民主价值观。因此,越来越需要自动化方法来检测和减轻此类内容,特别是考虑到对话的复杂性可能需要跨多种语言进行上下文分析,包括 Hinglish、German-English 和 Bangla 等混合语码语言。我们参与了英语任务,需要将英语推文分为两类:仇恨与攻击性,以及非仇恨与攻击性。在这项工作中,我们通过提示使用最先进的大型语言模型(如 GPT-3.5 Turbo)将推文分类为仇恨与攻击性或非仇恨与攻击性。在本研究中,我们通过三次独立运行中的 Macro-F1 分数来评估分类模型的性能。Macro-F1 分数平衡了所有类别的精确率和召回率,被用作模型评估的主要指标。运行 1 得分为 0.756,运行 2 得分为 0.751,运行 3 得分为 0.754,表明性能水平高且运行间方差极小。结果表明,该模型在精确率和召回率方面表现一致,其中运行 1 表现最佳。这些发现突显了该模型在不同运行中的鲁棒性和可靠性。

关键词

引用

@article{arxiv.2411.09214,
  title  = {HateGPT: Unleashing GPT-3.5 Turbo to Combat Hate Speech on X},
  author = {Aniket Deroy and Subhankar Maity},
  journal= {arXiv preprint arXiv:2411.09214},
  year   = {2025}
}

备注

Updated and Final Version