HateCOT:一个基于大语言模型的解释增强数据集,用于可泛化的攻击性言论检测
计算与语言
2024-10-08 v4 人工智能
社会与信息网络
摘要
社交媒体的广泛使用要求对攻击性内容进行可靠且高效的检测,以减轻有害影响。尽管复杂模型在单个数据集上表现良好,但由于对“攻击性内容”的定义和标注各不相同,它们往往难以泛化。在本文中,我们引入了HateCOT,一个包含超过52,000个来自不同来源样本的英文数据集,其特征是包含由GPT-3.5Turbo生成并经人工审核的解释。我们证明,在HateCOT上进行预训练,能显著提升开源大语言模型在三个攻击性内容检测基准数据集上的性能,无论是在零样本还是少样本设置下,尽管领域和任务存在差异。此外,HateCOT有助于在数据有限的情况下对LLM进行有效的K样本微调,并提高其解释的质量,这一点已通过我们的人工评估得到确认。
引用
@article{arxiv.2403.11456,
title = {HateCOT: An Explanation-Enhanced Dataset for Generalizable Offensive Speech Detection via Large Language Models},
author = {Huy Nghiem and Hal Daumé},
journal= {arXiv preprint arXiv:2403.11456},
year = {2024}
}
备注
EMNLP 2024 Findings