中文

SOS-1K:面向中文社交媒体分析的细粒度自杀风险分类数据集

计算与语言 2024-04-22 v1

摘要

在社交媒体中,用户经常表达个人情绪,其中一部分可能暗示潜在的自杀倾向。网络语言中隐含且多样的表达形式使得在社交媒体上准确、快速地识别自杀意图变得复杂,从而给及时干预工作带来挑战。开发用于自杀风险检测的深度学习模型是一种有前景的解决方案,但目前明显缺乏相关数据集,尤其是在中文语境下。为了填补这一空白,本研究提出了一个专为细粒度自杀风险分类设计的中文社交媒体数据集,重点关注自杀意图表达、自杀方式和时间紧迫性等指标。在两个任务中评估了七个预训练模型:高与低自杀风险,以及 0 到 10 级别的细粒度自杀风险分类。在我们的实验中,深度学习模型在区分高和低自杀风险方面表现出良好的性能,最佳模型达到了 88.39% 的 F1 分数。然而,细粒度自杀风险分类的结果仍不令人满意,加权 F1 分数为 50.89%。为了解决数据不平衡和数据集规模有限的问题,我们研究了传统和先进的基于大语言模型的数据增强技术,证明数据增强可以使模型的 F1 分数提高多达 4.65 个百分点。值得注意的是,在心理学领域数据上预训练的 Chinese MentalBERT 模型在两项任务中均表现出优越的性能。本研究为自杀个体的自动识别提供了有价值的见解,促进了社交媒体平台上的及时心理干预。源代码和数据已公开提供。

关键词

引用

@article{arxiv.2404.12659,
  title  = {SOS-1K: A Fine-grained Suicide Risk Classification Dataset for Chinese Social Media Analysis},
  author = {Hongzhi Qi and Hanfei Liu and Jianqiang Li and Qing Zhao and Wei Zhai and Dan Luo and Tian Yu He and Shuo Liu and Bing Xiang Yang and Guanghui Fu},
  journal= {arXiv preprint arXiv:2404.12659},
  year   = {2024}
}