中文

利用ChatGPT生成数据从社交媒体检索抑郁症状

计算与语言 2023-07-07 v2

摘要

在本工作中,我们介绍了BLUE团队在eRisk实验室抑郁症状搜索任务中的贡献。该任务旨在从BDI-II问卷中检索并排序传达抑郁症状的Reddit社交媒体句子。鉴于大语言模型(LLM)提供的合成数据已被证明是增强数据和微调下游模型的可靠方法,我们选择了使用ChatGPT为BDI-II问卷的每种症状生成合成数据。我们设计了一个提示,使得生成的数据比BDI-II对每个问题的回答具有更丰富的语义多样性,同时包含Reddit上特有的、更私密的分享经历的情感与轶事体验。我们执行语义搜索,并通过余弦相似度对句子与BDI-II症状的相关性进行排序。我们使用两个最先进的基于transformer的模型(MentalRoBERTa和MPNet的一个变体)来嵌入社交媒体帖子、BDI-II的原始与生成回答。我们的结果表明,使用为语义搜索设计的模型的句子嵌入优于使用在心理健康数据上预训练的模型的嵌入方法。此外,生成的合成数据被证明对该任务过于特定,仅依赖BDI-II回答的方法取得了最佳性能。

关键词

引用

@article{arxiv.2307.02313,
  title  = {Utilizing ChatGPT Generated Data to Retrieve Depression Symptoms from Social Media},
  author = {Ana-Maria Bucur},
  journal= {arXiv preprint arXiv:2307.02313},
  year   = {2023}
}