基于Transformer大型语言模型的反犹主义仇恨言论检测
计算与语言
2024-05-08 v1
摘要
学术研究人员和社交媒体实体在识别仇恨言论方面面临诸多挑战,主要源于数据的庞大规模和仇恨言论的动态性。鉴于大型预测模型如 ChatGPT 在直接解决此类敏感问题方面的伦理和实际限制,我们的研究自 2019 年起探索了替代性先进Transformer-based和生成式AI技术。具体而言,我们开发了一种新的数据标注技术,并以证明概念为目标,针对反犹主义仇恨言论,利用了各种Transformer模型,如 BERT (arXiv:1810.04805)、DistillBERT (arXiv:1910.01108)、RoBERTa (arXiv:1907.11692) 和 LLaMA-2 (arXiv:2307.09288),并辅以 LoRA 微调方法 (arXiv:2106.09685)。本文阐述并评估了这些前沿方法在解决仇恨言论检测复杂性方面的比较效果,突出了在敏感语境中谨慎管理AI应用的必要性。
引用
@article{arxiv.2405.03794,
title = {Detecting Anti-Semitic Hate Speech using Transformer-based Large Language Models},
author = {Dengyi Liu and Minghao Wang and Andrew G. Catlin},
journal= {arXiv preprint arXiv:2405.03794},
year = {2024}
}