基于 Reddit 的精神健康检测基准套件
计算与语言
2026-04-28 v1 信息检索
机器学习
摘要
在线支持小组的日益增长为通过自然语言处理(NLP)研究精神健康提供了新视野,但缺乏高质量、经验证实的数据集以致碍了进一步发展。现有研究倾向于构建特定任务的语料库,而未将其整合为广泛可获取的资源,这使得可重复性研究和跨任务比较困难。本文提出了统一的基准套件,包含四个基于 Reddit 的数据集,用于互不相冲但互补的四项任务:(i)自杀倾向检测,(ii)二分类一般精神障碍检测,(iii)双相情感障碍检测,(iv)多类别精神障碍分类。所有数据集均基于严谨的语言检查、明确的标注指南和人工判断验证。评估指标显示,各项标注者间一致性始终超过0.8,确保标签可靠性。先前工作表明,Transformer 和情境化循环模型在这些任务上取得优异性能(F1 ~ 93-99%),进一步验证了数据集的有用性。通过整合这些资源,我们建立了可重复的精神健康 NLP 研究基础,支持跨任务基准测试、多任务学习和公平模型比较。该基准套件为研究社区提供了便捷获取且资源丰富的渠道,以推动计算方法在精神健康领域的发展。
引用
@article{arxiv.2604.23458,
title = {A Benchmark Suite of Reddit-Derived Datasets for Mental Health Detection},
author = {Khalid Hasan and Jamil Saquer},
journal= {arXiv preprint arXiv:2604.23458},
year = {2026}
}
备注
In the proceedings of 12th Annual Conference on Computational Science & Computational Intelligence (CSCI'25)