STATE ToxiCN:面向中文仇恨言论的基于片段级别目标感知有害内容抽取基准
计算与语言
2025-05-21 v3
摘要
仇恨言论的扩散对社会造成了显著危害。仇恨的强度和方向性与其所关联的目标和论点密切相关。然而,中文仇恨言论检测研究滞后,现有数据集缺乏片段级别的细粒度标注。此外,对中文仇恨俚语的研究也是一个重要挑战。本文提供了中文仇恨言论细粒度检测的解决方案。首先,我们构建了一个包含目标-论点-有害-群体四元组(STATE ToxiCN)的数据集,这是第一个片段级别的中文仇恨言论数据集。其次,我们使用 STATE ToxiCN 评估现有模型在片段级别仇恨言论检测中的性能。最后,我们首次研究中文仇恨俚语,评估大语言模型检测此类表达的能力。我们的工作为推动中文仇恨言论的片段级别检测提供了宝贵的资源和见解。
引用
@article{arxiv.2501.15451,
title = {STATE ToxiCN: A Benchmark for Span-level Target-Aware Toxicity Extraction in Chinese Hate Speech Detection},
author = {Zewen Bai and Shengdi Yin and Junyu Lu and Jingjie Zeng and Haohao Zhu and Yuanyuan Sun and Liang Yang and Hongfei Lin},
journal= {arXiv preprint arXiv:2501.15451},
year = {2025}
}
备注
Our paper has been accepted by ACL 2025 Findings