中文

利用大型语言模型中的思维链推理调节新的在线仇恨浪潮

计算与语言 2024-07-03 v2 计算机与社会 机器学习 社会与信息网络

摘要

在线仇恨是一个日益严重的问题,对互联网用户的生活产生负面影响,并且由于不断演变的事件而迅速变化,导致新的在线仇恨浪潮构成严重威胁。检测和缓解这些新浪潮面临两个关键挑战:它需要基于推理的复杂决策来确定仇恨内容的存在,并且训练样本的有限可用性阻碍了检测模型的更新。为了解决这个关键问题,我们提出了一个名为HATEGUARD的新框架,用于有效调节新的在线仇恨浪潮。HATEGUARD采用基于推理的方法,利用最近引入的思维链(CoT)提示技术,利用大型语言模型(LLM)的能力。HATEGUARD通过自动生成和更新检测提示,使用新浪潮样本中的新贬义术语和目标,进一步实现了基于提示的零样本检测,以有效应对新的在线仇恨浪潮。为了证明我们方法的有效性,我们编译了一个新数据集,包含与最近观察到的三个新浪潮相关的推文:2022年俄罗斯入侵乌克兰、2021年美国国会大厦暴动和COVID-19大流行。我们的研究揭示了这些新浪潮中关于事件演变的关键纵向模式,以及迫切需要快速更新现有调节工具以应对它们的技术。与最先进工具的比较评估显示了我们的框架的优越性,在检测三个新的在线仇恨浪潮方面展示了22.22%到83.33%的显著改进。我们的工作强调了新在线仇恨浪潮出现的严重威胁,并代表了实际应对这一威胁的范式转变。

关键词

引用

@article{arxiv.2312.15099,
  title  = {Moderating New Waves of Online Hate with Chain-of-Thought Reasoning in Large Language Models},
  author = {Nishant Vishwamitra and Keyan Guo and Farhan Tajwar Romit and Isabelle Ondracek and Long Cheng and Ziming Zhao and Hongxin Hu},
  journal= {arXiv preprint arXiv:2312.15099},
  year   = {2024}
}

备注

To Appear in the 45th IEEE Symposium on Security and Privacy, May 20-23, 2024