中文

FedMental:评估基于社交媒体数据的心理健康检测中的联邦学习

机器学习 2026-05-20 v1 计算与语言

摘要

社交媒体文本数据常用于训练机器学习模型以识别表现出高风险心理健康行为的用户。然而,共享此类敏感数据会带来隐私风险,并限制基准数据集的增长。我们全面评估了隐私保护机器学习技术是否能够在保持性能的同时实现更安全的数据共享。具体而言,我们针对两种广泛研究的心理健康预测任务应用联邦学习(FL)和差分隐私联邦学习:一种是针对X(Twitter)上的抑郁检测,另一种是针对Reddit上的自杀危机检测。通过将每个用户视为联邦学习中的客户端,在非独立同分布(non-IID)设置下评估不同的客户端比例、聚合策略和隐私预算。虽然FL在抑郁识别方面实现了与集中训练相当的性能(集中式F1 = 85.63;最佳FL模型F1 = 83.16),但我们发现差分隐私FL在即使噪声水平较低(epsilon = 50)时,也存在显著的性能-隐私权衡(最高达F1下降27.01),这源于高度信息稀疏的心理健康语言标记(如健康主题和情感词)被扭曲。该研究经验性地展示了当前隐私保护技术在心理健康推断任务中潜力与局限性。

关键词

引用

@article{arxiv.2605.18936,
  title  = {FedMental: Evaluating Federated Learning for Mental Health Detection from Social Media Data},
  author = {Nuredin Ali Abdelkadir and Anjali Ratnam and Zeerak Talat and Stevie Chancellor},
  journal= {arXiv preprint arXiv:2605.18936},
  year   = {2026}
}

备注

Association for Computational Linguistics (ACL) 2026 Main Conference