中文

K-QA:一个真实世界的医学问答基准

计算与语言 2024-01-29 v1 人机交互 机器学习

摘要

确保大型语言模型(LLMs)回答的准确性至关重要,尤其是在临床环境中,错误信息可能直接影响患者健康。为应对这一挑战,我们构建了K-QA数据集,其中包含1,212个源自K Health(一个AI驱动的临床平台)真实对话的患者问题。我们聘请了一个内部医生小组来回答K-QA的一个子集,并将其手动分解为自包含的陈述。此外,我们制定了两个基于自然语言推理(NLI)的评估指标,以近似衡量召回率和精确率:(1)全面性,衡量生成答案中包含的基本临床信息的百分比;(2)幻觉率,衡量医生策划的回答中被LLM答案所矛盾的陈述数量。最后,我们使用K-QA和这些指标评估了几个最先进的模型,以及上下文学习和作者开发的面向医学的增强检索方案的效果。我们的研究结果表明,上下文学习提高了模型的全面性,而增强检索能有效减少幻觉。我们将K-QA提供给社区,以促进医学上准确的NLP应用研究。

关键词

引用

@article{arxiv.2401.14493,
  title  = {K-QA: A Real-World Medical Q&A Benchmark},
  author = {Itay Manes and Naama Ronn and David Cohen and Ran Ilan Ber and Zehavi Horowitz-Kugler and Gabriel Stanovsky},
  journal= {arXiv preprint arXiv:2401.14493},
  year   = {2024}
}

备注

The data and the evaluation script are available at https://github.com/Itaymanes/K-QA. Results and model comparisons can be viewed at https://huggingface.co/spaces/Itaykhealth/K-QA