中文

利用弱标注数据进行混合语 Hinglish 仇恨言论检测:基于大型语言模型的可行性驱动迁移学习方法

计算与语言 2024-03-05 v1 人工智能

摘要

大型语言模型(LLMs)的出现推进了各种自然语言处理(NLP)任务的基准。然而,训练 LLMs 需要大量带标签的训练数据。此外,数据标注和训练在计算上昂贵且耗时。零样本和少样本学习最近已成为使用大型预训练模型标记数据的可行选择。混合编码低资源语言中的仇恨言论检测是一个活跃的问题领域,LLMs 的使用已被证明是有益的。在本研究中,我们编制了一个包含 100 条 YouTube 评论的数据集,并对它们进行了弱标记,用于混合编码 Hinglish 中的粗粒度和细粒度厌女症分类。由于标注过程耗费人力,因此采用了弱标注。然后应用了零样本学习、单样本学习和少样本学习及提示方法,为评论分配标签并将其与人类分配的标签进行比较。在所有方法中,使用双向自回归变换器(BART)大模型进行的零样本分类和使用生成式预训练变换器 3(ChatGPT-3)的少样本提示取得了最佳结果。

关键词

引用

@article{arxiv.2403.02121,
  title  = {Leveraging Weakly Annotated Data for Hate Speech Detection in Code-Mixed Hinglish: A Feasibility-Driven Transfer Learning Approach with Large Language Models},
  author = {Sargam Yadav and Abhishek Kaushik and Kevin McDaid},
  journal= {arXiv preprint arXiv:2403.02121},
  year   = {2024}
}

备注

This paper is accepted in the 16th ISDSI-Global Conference 2023 https://isdsi2023.iimranchi.ac.in