中文

MindSET: 通过大规模社交媒体数据推进心理健康基准测试

计算与语言 2025-11-27 v1 人工智能

摘要

社交媒体数据已成为研究心理健康的重要资源,提供对思想、情感和行为的实时洞察,这些是传统方法常忽略的。该领域的进展得益于心理健康分析的基准数据集;然而,大多数现有基准数据集因数据可用性有限、处理不充分以及社交媒体内容固有的多样性(例如多语言和有害内容)而已过时。我们提出了新的基准数据集\textbf{MindSET},源自Reddit并使用自我报告诊断进行标注,以解决上述局限性。该标注数据集包含超过\textbf{1300万}个标注帖子,覆盖七种心理健康状况,规模是现有基准数据的两倍以上。为确保数据质量,我们应用了严格的预处理步骤,包括语言过滤,并删除了可能不适合工作场所(NSFW)和重复内容。我们进一步使用LIWC进行语言分析,以检查数据集中八个代表组中心理术语的频率。为演示数据集的实用性,我们对诊断检测进行二分类实验,使用微调语言模型和词袋(BoW)特征。在MindSET上训练的模型在诊断检测方面持续优于先前基准数据集,自闭症检测的F1分数提升最高可达\textbf{18分}。总体而言,MindSET为探索社交媒体与心理健康交叉领域的研究者提供了稳健的基础,支持早期风险检测和更深入的心理趋势分析。

关键词

引用

@article{arxiv.2511.20672,
  title  = {MindSET: Advancing Mental Health Benchmarking through Large-Scale Social Media Data},
  author = {Saad Mankarious and Ayah Zirikly and Daniel Wiechmann and Elma Kerz and Edward Kempa and Yu Qiao},
  journal= {arXiv preprint arXiv:2511.20672},
  year   = {2025}
}