中文

用于检测仇恨、辱骂和亵渎的高效模型

计算与语言 2024-02-09 v1 人工智能 人机交互

摘要

大型语言模型(LLM)是许多自然语言处理(NLP)任务的基石,如情感分析、文档分类、命名实体识别、问答、摘要等。LLM通常使用源自网络的数据进行训练。这些数据容易包含仇恨、辱骂和亵渎(HAP)内容。关于HAP的详细定义,请参考附录。由于LLM在训练期间暴露于HAP内容,模型会学习这些内容,并可能生成仇恨或亵渎性内容。例如,当HuggingFace(HF)Transformers库中的开源RoBERTa模型(具体为RoBERTa base模型)被提示替换`I do not know that Persian people are that MASK`中的掩码标记时,它返回得分最高的单词`stupid`。这在文明对话中是不可接受的。文本中仇恨、辱骂和亵渎的检测是创建文明且无偏见的LLM的关键组成部分,这不仅需要英语,也需要所有语言。本文简要描述了HAP检测器的创建,以及使用它们使模型在其生成的输出中变得文明和可接受的多种方法。

关键词

引用

@article{arxiv.2402.05624,
  title  = {Efficient Models for the Detection of Hate, Abuse and Profanity},
  author = {Christoph Tillmann and Aashka Trivedi and Bishwaranjan Bhattacharjee},
  journal= {arXiv preprint arXiv:2402.05624},
  year   = {2024}
}

备注

8 pages, 7 figures