中文

CARMA:面向阿拉伯语的全面自动标注Reddit心理健康数据集

计算与语言 2025-11-06 v1 人工智能

摘要

心理健康障碍影响着全球数百万人,然而早期检测仍然是一个重大挑战,特别是对于阿拉伯语人群而言,其资源有限,且由于文化污名,心理健康讨论常常受到阻碍。虽然大量研究集中在英语心理健康检测上,但阿拉伯语仍然严重未被探索,部分原因是标注数据集的稀缺。我们提出了CARMA,这是第一个大规模自动标注的阿拉伯语Reddit帖子数据集。该数据集涵盖了六种心理健康状况,如焦虑症、自闭症和抑郁症,以及一个对照组。CARMA在规模和多样性上都超越了现有资源。我们对用户之间的词汇和语义差异进行了定性和定量分析,提供了对特定心理健康状况语言标记的见解。为了展示该数据集在进一步心理健康分析方面的潜力,我们使用从浅层分类器到大型语言模型的一系列模型进行了分类实验。我们的结果突显了在阿拉伯语等代表性不足的语言中推进心理健康检测的前景。

关键词

引用

@article{arxiv.2511.03102,
  title  = {CARMA: Comprehensive Automatically-annotated Reddit Mental Health Dataset for Arabic},
  author = {Saad Mankarious and Ayah Zirikly},
  journal= {arXiv preprint arXiv:2511.03102},
  year   = {2025}
}