SCCD:面向中文网络欺凌检测的会话数据集
计算与语言
2025-01-28 v1
摘要
网络欺凌内容的广泛传播对社会福祉构成日益严峻的威胁。然而,针对中文网络欺凌检测的研究仍不成熟,主要由于缺乏全面可靠的数据集。值得注意的是,现有中文数据集并未专门针对网络欺凌检测设计。此外,尽管评论在会话中发挥着关键作用,但当前的会话级数据集往往缺乏对评论级别的详细、细粒度标注。为此,我们提出一种新型中文网络欺凌数据集,称为 SCCD,包含来自主要社交媒体平台微博的 677 个会话级样本。此外,对每个会话中的每个评论都进行了细粒度标注,而非传统的二元类别标注。经验上,我们在 SCCD 上评估了各种基线方法,凸显了有效中文网络欺凌检测的挑战。
引用
@article{arxiv.2501.15042,
title = {SCCD: A Session-based Dataset for Chinese Cyberbullying Detection},
author = {Qingpo Yang and Yakai Chen and Zihui Xu and Yu-ming Shang and Sanchuan Guo and Xi Zhang},
journal= {arXiv preprint arXiv:2501.15042},
year = {2025}
}