你的模型未能很好地预测抑郁症及其原因:PRIMATE 数据集案例研究
计算与语言
2024-03-04 v1
摘要
本文探讨了用于基于自然语言处理(NLP)从社交媒体文本估计抑郁水平的心理健康数据集中的标注质量问题。虽然先前的研究依赖于标注为二元类别(即抑郁或非抑郁)的基于社交媒体的数据集,但最近的数据集(如 D2S 和 PRIMATE)旨在利用 PHQ-9 症状进行更细致的标注。然而,这些数据集大多依赖缺乏领域知识的众包工人进行标注。聚焦于 PRIMATE 数据集,我们的研究揭示了关于标注有效性的担忧,特别是针对缺乏兴趣或愉悦感这一症状。通过由心理健康专业人员重新标注,我们引入了更精细的标签和作为证据的文本跨度,识别出大量假阳性。我们 refined 的标注将在数据使用协议下发布,为快感缺失检测提供更高质量的测试集。本研究强调了解决心理健康数据集中标注质量问题的必要性,倡导改进方法论以增强 NLP 模型在心理健康评估中的可靠性。
引用
@article{arxiv.2403.00438,
title = {Your Model Is Not Predicting Depression Well And That Is Why: A Case Study of PRIMATE Dataset},
author = {Kirill Milintsevich and Kairit Sirts and Gaël Dias},
journal= {arXiv preprint arXiv:2403.00438},
year = {2024}
}