中文

MHQA:面向语言模型的多样化、知识密集型精神健康问答挑战

计算与语言 2025-02-24 v1

摘要

精神健康是全球范围内面临的挑战,抑郁、焦虑等问题日益突出。大语言模型(LLM)在医疗领域的应用日益广泛,尤其在医学问答方面。然而,目前缺乏针对精神健康领域问答(QA)的标准化基准数据集。我们的工作提出了一套新颖的多选数据集MHQA(Mental Health Question Answering),用于评估语言模型。以往的精神健康数据集主要聚焦于将文本分类为特定标签或疾病,而MHQA则聚焦于精神健康问答,涵盖焦虑、抑郁、创伤和强迫/强症状四大关键领域,包含多样化的问答类型,包括事实性、诊断性、预后性和预防性问题。我们以PubMed摘要为问答的主要来源。我们构建了一个严格的管道,用于基于各种选择标准通过大语言模型识别信息并转换为问答对。进一步地,依据事后验证标准提取有效的问答对。总体而言,我们的MHQA数据集包含2,475个经专家验证的金标准实例(称为MHQA-gold)以及约56.1k对伪标记的问答对。我们报告了在不同语言模型上的F1分数,并进行了few-shot和监督微调实验,进一步讨论了得分的洞见。

关键词

引用

@article{arxiv.2502.15418,
  title  = {MHQA: A Diverse, Knowledge Intensive Mental Health Question Answering Challenge for Language Models},
  author = {Suraj Racha and Prashant Joshi and Anshika Raman and Nikita Jangid and Mridul Sharma and Ganesh Ramakrishnan and Nirmal Punjabi},
  journal= {arXiv preprint arXiv:2502.15418},
  year   = {2025}
}