大型语言模型在现实世界仇恨言论检测中的调查
计算机与社会
2024-01-09 v1 人工智能
计算与语言
机器学习
社会与信息网络
摘要
仇恨言论已成为当今困扰我们社会空间的一个主要问题。虽然已有大量努力来解决这一问题,但现有方法在有效检测在线仇恨言论方面仍然受到显著限制。现有方法的一个主要局限是,仇恨言论检测是一个高度上下文相关的问题,而这些方法无法完全捕捉仇恨言论的上下文以做出准确预测。最近,大型语言模型(LLMs)在多项自然语言任务中展示了最先进的性能。LLMs 经过海量自然语言数据的广泛训练,使其能够掌握复杂的上下文细节。因此,它们可用作上下文感知仇恨言论检测的知识库。然而,使用 LLMs 检测仇恨言论的一个根本问题是,目前尚无关于如何有效提示 LLMs 进行上下文感知仇恨言论检测的研究。在本研究中,我们利用五个既定的仇恨言论数据集进行了大规模研究。我们发现,LLMs 不仅在识别仇恨言论方面达到了当前基准机器学习模型的水平,而且往往超越了它们。通过提出四种多样化的提示策略以优化 LLMs 在仇恨言论检测中的应用,我们的研究表明,精心设计的推理提示可以通过充分利用 LLMs 中的知识库来有效捕捉仇恨言论的上下文,显著优于现有技术。此外,尽管 LLMs 能为仇恨言论的上下文检测提供丰富的知识库,但合适的提示策略在有效利用该知识库进行高效检测方面起着至关重要的作用。
引用
@article{arxiv.2401.03346,
title = {An Investigation of Large Language Models for Real-World Hate Speech Detection},
author = {Keyan Guo and Alexander Hu and Jaden Mu and Ziheng Shi and Ziming Zhao and Nishant Vishwamitra and Hongxin Hu},
journal= {arXiv preprint arXiv:2401.03346},
year = {2024}
}
备注
Accepted for publication on 22nd International Conference of Machine Learning and Applications, ICMLA 2023