中文

面向多答案与多焦点问题的抽取式临床问答数据集构建

计算与语言 2023-06-27 v2

摘要

背景:抽取式问答(EQA)是一种有用的自然语言处理(NLP)应用,可通过在临床记录中定位答案来回答患者特定问题。真实的临床 EQA 可能存在单个问题对应多个答案以及单个问题中包含多个焦点的情况,而现有用于人工智能解决方案开发的数据集缺乏此类特性。目的:创建一个用于开发和评估能够处理自然多答案与多焦点问题的临床 EQA 系统的数据集。方法:我们利用 2018 年 National NLP Clinical Challenges(n2c2)语料库的标注关系来生成 EQA 数据集。具体而言,纳入了 1 对 N、M 对 1 和 M 对 N 的药物-原因关系,以构成多答案与多焦点问答条目,除基础的一药一因情形外,其代表了更复杂且自然的挑战。我们开发了一个基线方案并在该数据集上进行了测试。结果:所衍生的 RxWhyQA 数据集包含 96,939 个问答条目。在可回答问题中,25% 需要多个答案,2% 在一个问题中询问多种药物。文本中答案周围观察到频繁线索,90% 的药物与原因术语出现在同一句或相邻句中。基线 EQA 方案在整个数据集上取得了 0.72 的最佳 f1-measure,在特定子集上分别为:不可回答问题 0.93,单药问题 0.48 对比多药问题 0.60,单答案问题 0.54 对比多答案问题 0.43。讨论:RxWhyQA 数据集可用于训练和评估需要处理多答案与多焦点问题的系统。具体而言,多答案 EQA 似乎具有挑战性,因此值得投入更多研究。

关键词

引用

@article{arxiv.2201.02517,
  title  = {Development of an Extractive Clinical Question Answering Dataset with Multi-Answer and Multi-Focus Questions},
  author = {Sungrim Moon and Huan He and Hongfang Liu and Jungwei W. Fan},
  journal= {arXiv preprint arXiv:2201.02517},
  year   = {2023}
}

备注

2 tables, 5 figures