中文

基于元毒性知识图谱的增强型大语言模型仇恨与毒性检测

计算与语言 2025-06-03 v4 人工智能

摘要

社交媒体平台的快速发展引发了对在线内容毒性的广泛关注。当大语言模型(LLM)用于毒性检测时,会出现两个关键挑战:1)缺乏领域特定的毒性知识导致漏报;2)大语言模型对毒性言论过度敏感,产生误报,限制了言论自由。为解决这些问题,我们提出了一种新方法,即MetaTox,通过在元毒性知识图谱上进行图搜索来增强仇恨和毒性检测。首先,我们通过三步骤管道利用大语言模型提取毒性信息,构建全面的元毒性知识图谱,毒性基准数据集作为语料。其次,通过检索和排序过程查询该图谱,以补充准确、相关的毒性知识。广泛的实验和深入的案例研究表明,MetaTox显著降低了误报率,同时提升了整体毒性检测性能。我们的代码已公开于 https://github.com/YiboZhao624/MetaTox。

关键词

引用

@article{arxiv.2412.15268,
  title  = {Enhancing LLM-based Hatred and Toxicity Detection with Meta-Toxic Knowledge Graph},
  author = {Yibo Zhao and Jiapeng Zhu and Can Xu and Yao Liu and Xiang Li},
  journal= {arXiv preprint arXiv:2412.15268},
  year   = {2025}
}

备注

8 pages of content