Su-RoBERTa:基于基础语言模型的社交媒体自杀风险预测半监督方法
人机交互
2024-12-20 v2 人工智能
社会与信息网络
摘要
近年来,越来越多的人在各种社交媒体平台上发布关于其心理状态的信息。利用这些数据,可以开发出帮助评估个体心理健康状况的 AI 系统,如自杀风险预测。这篇论文聚焦于利用 Reddit 数据进行自杀风险评估,采用基础语言模型从社交媒体帖子中识别模式。我们展示了使用较小的语言模型(即参数不足 5 亿)也同样有效,这与参数超过 5 亿的大型语言模型 (LLM) 相比。我们提出的 Su-RoBERTa 是一个在自杀风险预测任务上微调的 RoBERTa,利用了标记和未标记的 Reddit 数据,并通过 GPT-2 模型进行数据增强以解决类别不平衡问题。我们的 Su-RoBERTa 模型在最终评估中获得了 69.84% 的加权 F1 分数。这篇论文表明,基础语言模型对于分析与心理健康相关的风险因素具有有效性,同时具备高效计算管道。
引用
@article{arxiv.2412.01353,
title = {Su-RoBERTa: A Semi-supervised Approach to Predicting Suicide Risk through Social Media using Base Language Models},
author = {Chayan Tank and Shaina Mehta and Sarthak Pol and Vinayak Katoch and Avinash Anand and Raj Jaiswal and Rajiv Ratn Shah},
journal= {arXiv preprint arXiv:2412.01353},
year = {2024}
}
备注
8 pages, 7 figures, Accepted at IEEE International Conference on Big Data (IEEE BigData 2024)