增强 Reddit 帖子以判定影响心理健康的健康维度
计算与语言
2023-06-08 v1 计算机与社会
摘要
在持续的健康危机中,越来越有必要从自我叙述的文本中辨识健康维度(WD)可能显现的迹象。由于社交媒体数据上 WD 的分布本质上不平衡,我们尝试使用生成式 NLP 模型进行数据增强,以进一步改进 WD 分类的预筛查任务。为此,我们提出了一种通过基于提示的生成式 NLP 模型实现的简单而有效的数据增强方法,并评估了现有解释与增强数据之间的 ROUGE 分数以及句法/语义相似度。我们使用 ChatGPT 模型的方法超越了所有其他方法,并相对于 Easy-Data Augmentation 和回译等基线取得了改进。引入数据增强以生成更多训练样本和平衡数据集,使 F 值和马修斯相关系数分别提高了至多 13.11% 和 15.95%。
引用
@article{arxiv.2306.04059,
title = {Augmenting Reddit Posts to Determine Wellness Dimensions impacting Mental Health},
author = {Chandreen Liyanage and Muskan Garg and Vijay Mago and Sunghwan Sohn},
journal= {arXiv preprint arXiv:2306.04059},
year = {2023}
}