中文网络欺凌检测:数据集、方法与验证
计算与语言
2026-05-12 v2 人工智能
摘要
现有的网络欺凌检测基准是按言论的极性(如“攻击性”和“非攻击性”)组织的,这本质上是仇恨言论检测。然而,在现实世界中,网络欺凌往往通过事件引起广泛的社会关注。为解决这一问题,我们提出了一种新颖的标注方法来构建一个按事件组织的网络欺凌数据集。所构建的CHNCI是首个中文网络欺凌事件检测数据集,包含91个事件中的220,676条评论。具体来说,我们首先结合三种基于解释生成的网络欺凌检测方法作为集成方法来生成伪标签,然后让人工标注员判断这些标签。接着,我们提出了用于验证是否构成网络欺凌事件的评估标准。实验结果表明,所构建的数据集可以作为网络欺凌检测和事件预测任务的基准。据我们所知,这是首个针对中文网络欺凌事件检测任务的研究。
引用
@article{arxiv.2505.20654,
title = {Chinese Cyberbullying Detection: Dataset, Method, and Validation},
author = {Yi Zhu and Xin Zou and Xindong Wu},
journal= {arXiv preprint arXiv:2505.20654},
year = {2026}
}