中文

CNSocialDepress:面向中文社交媒体的抑郁风险检测与结构化分析数据集

计算与语言 2026-05-12 v3

摘要

抑郁是一全球性公共卫生问题,但公开可获取的中文语言资源用于抑郁风险检测仍稀缺且主要关注二元分类。为克服这一限制,我们发布 CNSocialDepress,这是一个用于中文社交媒体抑郁风险检测的基准数据集。该数据集包含来自 233 位用户的 44,178 条帖子;心理专家标注了 10,306 条抑郁相关片段。CNSocialDepress 提供二元风险标签以及结构化的多维心理属性,实现对抑郁信号的可解释且细粒度的分析。实验结果表明,该数据集在广泛的 NLP 任务中具有实用性,包括结构化心理轮廓绘制和针对抑郁检测的大语言模型微调。全面评估凸显了该数据集在抑郁风险识别和心理分析方面的有效性和实际价值,从而为针对中文-speaking 人群的心理健康应用提供了洞见。

关键词

引用

@article{arxiv.2510.11233,
  title  = {CNSocialDepress: A Chinese Social Media Dataset for Depression Risk Detection and Structured Analysis},
  author = {Jinyuan Xu and Tian Lan and Xintao Yu and Xue He and Hezhi Zhang and Ying Wang and Pierre Magistry and Mathieu Valette and Lei Li},
  journal= {arXiv preprint arXiv:2510.11233},
  year   = {2026}
}