中文

MeDiaQA:一个基于医疗对话的问答数据集

计算与语言 2021-08-19 v1 人工智能

摘要

在本文中,我们介绍了 MeDiaQA,一个构建于真实在线医疗对话之上的新型问答(QA)数据集。它包含由人工标注的 22k 道多项选择题,覆盖 11k 余段患者与医生间共 120k 条话语的对话,涵盖从 haodf.com 与 dxy.com 收集的 150 种疾病专科。MeDiaQA 是首个对医疗对话(尤其是其中的量化内容)进行推理的 QA 数据集。该数据集有潜力测试模型跨多轮对话的计算、推理与理解能力,相较于现有数据集更具挑战性。为应对这些挑战,我们设计了 MeDia-BERT,其达到了 64.3% 的准确率,而人类准确率为 93%,这表明仍有很大改进空间。

关键词

引用

@article{arxiv.2108.08074,
  title  = {MeDiaQA: A Question Answering Dataset on Medical Dialogues},
  author = {Huqun Suri and Qi Zhang and Wenhua Huo and Yan Liu and Chunsheng Guan},
  journal= {arXiv preprint arXiv:2108.08074},
  year   = {2021}
}