细粒度中文仇恨言论理解:基于区间的资源、仇恨词汇表及增强检测框架
计算与语言
2025-07-16 v1
摘要
仇恨言论的不断扩散已对社会造成显著伤害,其强度和方向性与特定目标和论点密切相关。近年来,众多基于机器学习的方法被开发用于自动检测在线平台上的仇恨评论。然而,中文仇恨言论检测仍滞后,解释性研究面临两个主要挑战:首先,稀缺的基于区间的细粒度标注数据集限制了模型对仇恨言论深层语义的理解;其次,针对识别和解释隐性仇恨语言的研究不足,限制了模型在复杂现实场景中的可解释性。为此,我们作出以下贡献:(1)我们引入了基于目标的毒性提取数据集(STATE ToxiCN),这是第一个中文仇恨言论数据集的基于区间层级,评估了现有模型在其上的仇恨语义理解能力。(2)我们进行了对中文隐性仇恨词汇的首次全面研究,探讨了大语言模型(LLM)的仇恨语义解释能力。(3)我们提出一种方法将标注词汇表整合到模型中,显著提升了仇恨言论检测性能。我们的工作为推动中文仇恨言论检测研究的可解释性提供了宝贵资源和见解。
引用
@article{arxiv.2507.11292,
title = {Fine-Grained Chinese Hate Speech Understanding: Span-Level Resources, Coded Term Lexicon, and Enhanced Detection Frameworks},
author = {Zewen Bai and Liang Yang and Shengdi Yin and Yuanyuan Sun and Hongfei Lin},
journal= {arXiv preprint arXiv:2507.11292},
year = {2025}
}