中文

解码仇恨:探索语言模型对仇恨言论的反应

计算与语言 2025-06-10 v1

摘要

仇恨言论是一种有害的线上表达形式,常以侮辱性帖子的形式出现。在数字环境中构成重大风险。随着大语言模型(LLM)的兴起,人们担忧这些模型会因训练数据来源于未经审查的互联网内容而复制仇恨言论模式。理解 LLM 对仇恨言论的响应方式对于其负责任的部署至关重要。然而,目前对 LLM 面对仇恨言论的行为研究仍有限。本文调查了七种最先进的大语言模型(LLaMA 2、Vicuna、LLaMA 3、Mistral、GPT-3.5、GPT-4 和 Gemini Pro)对仇恨言论的反应。通过定性分析,我们旨在揭示这些模型产生的响应谱,凸显其处理仇恨言论输入的能力。我们还讨论了通过微调和指导方针监控来缓解 LLM 生成仇恨言论的策略。最后,我们探讨了这些模型对以「 politically correct 语言」表达的仇恨言论的反应。

关键词

引用

@article{arxiv.2410.00775,
  title  = {Decoding Hate: Exploring Language Models' Reactions to Hate Speech},
  author = {Paloma Piot and Javier Parapar},
  journal= {arXiv preprint arXiv:2410.00775},
  year   = {2025}
}