中文

Su-RoBERTa:基于基础语言模型的社交媒体自杀风险预测半监督方法

人机交互 2024-12-20 v2 人工智能 社会与信息网络

摘要

近年来,越来越多的人在各种社交媒体平台上发布关于其心理状态的信息。利用这些数据,可以开发出帮助评估个体心理健康状况的 AI 系统,如自杀风险预测。这篇论文聚焦于利用 Reddit 数据进行自杀风险评估,采用基础语言模型从社交媒体帖子中识别模式。我们展示了使用较小的语言模型(即参数不足 5 亿)也同样有效,这与参数超过 5 亿的大型语言模型 (LLM) 相比。我们提出的 Su-RoBERTa 是一个在自杀风险预测任务上微调的 RoBERTa,利用了标记和未标记的 Reddit 数据,并通过 GPT-2 模型进行数据增强以解决类别不平衡问题。我们的 Su-RoBERTa 模型在最终评估中获得了 69.84% 的加权 F1 分数。这篇论文表明,基础语言模型对于分析与心理健康相关的风险因素具有有效性,同时具备高效计算管道。

关键词

引用

@article{arxiv.2412.01353,
  title  = {Su-RoBERTa: A Semi-supervised Approach to Predicting Suicide Risk through Social Media using Base Language Models},
  author = {Chayan Tank and Shaina Mehta and Sarthak Pol and Vinayak Katoch and Avinash Anand and Raj Jaiswal and Rajiv Ratn Shah},
  journal= {arXiv preprint arXiv:2412.01353},
  year   = {2024}
}

备注

8 pages, 7 figures, Accepted at IEEE International Conference on Big Data (IEEE BigData 2024)