利用人工智能打击网络仇恨:探索大语言模型在仇恨言论检测中的挑战与机遇
计算与语言
2024-03-14 v1 人工智能
摘要
大语言模型(Large language models, LLMs)在语言生成之外的许多多样化应用中表现出色,例如翻译、摘要和情感分析。一个引人关注的应用是文本分类。这在识别仇恨或有毒言论的领域中变得尤为重要——这是一个充满挑战和伦理困境的领域。在我们的研究中,我们有两个目标:首先,提供一篇围绕LLMs作为分类器的文献综述,强调它们在检测和分类仇恨或有毒内容中的作用。随后,我们探讨了几种LLMs在分类仇恨言论方面的效能:识别哪些LLMs在此任务中表现优异,以及它们的底层属性和训练方式。从而深入了解哪些因素有助于LLM辨别仇恨内容的能力(或缺乏能力)。通过将全面的文献综述与实证分析相结合,我们的论文力求揭示LLMs在仇恨言论检测这一关键领域的能力与局限。
引用
@article{arxiv.2403.08035,
title = {Harnessing Artificial Intelligence to Combat Online Hate: Exploring the Challenges and Opportunities of Large Language Models in Hate Speech Detection},
author = {Tharindu Kumarage and Amrita Bhattacharjee and Joshua Garland},
journal= {arXiv preprint arXiv:2403.08035},
year = {2024}
}