利用大语言模型提取的依据实现可解释的仇恨言论检测
计算与语言
2024-05-09 v2 人工智能
机器学习
摘要
尽管社交媒体平台是用户进行人际讨论和表达观点的重要场所,但社交媒体提供的伪装和匿名性可能允许用户散布仇恨言论和攻击性内容。鉴于此类平台的巨大规模,自动识别和标记仇恨言论实例的需求应运而生。虽然已有多种仇恨言论检测方法,但其中大多数黑箱方法在设计上不可解释或无法说明。为解决可解释性不足的问题,本文提出使用最先进的大语言模型(LLMs)从输入文本中提取特征(形式为“依据”),以训练一个基础的仇恨言论分类器,从而通过设计实现忠实的可解释性。我们的框架有效结合了 LLM 的文本理解能力和最先进仇恨言论分类器的判别能力,使这些分类器变得忠实可解释。我们在多种英语社交媒体仇恨言论数据集上的综合评估证明:(1)LLM 提取依据的优良性,以及(2)即使在为确保可解释性而进行训练后,检测器性能仍能惊人地保持。所有代码和数据将在 https://github.com/AmritaBh/shield 提供。
引用
@article{arxiv.2403.12403,
title = {Towards Interpretable Hate Speech Detection using Large Language Model-extracted Rationales},
author = {Ayushi Nirmal and Amrita Bhattacharjee and Paras Sheth and Huan Liu},
journal= {arXiv preprint arXiv:2403.12403},
year = {2024}
}
备注
Camera-ready for NAACL WOAH 2024 (Workshop on Online Abuse and Harms). First two authors contributed equally