中文

面向生物医学抽取式问答的序列标注方法

计算与语言 2022-07-08 v2

摘要

当前抽取式问答(EQA)的研究建模了单片段抽取设定,即对于给定问题-段落对,预测单个答案片段作为标签。该设定在通用领域EQA中是自然的,因为通用领域中大多数问题可用单个片段回答。遵循通用领域EQA模型,当前的生物医学EQA(BioEQA)模型利用带后处理步骤的单片段抽取设定。在本文中,我们调查了通用与生物医学领域的问题分布,发现生物医学问题比事实型答案(单答案)更需要列表型答案(多答案)。这使得模型需要具备为一个问题生成多个答案的能力。基于该初步研究,我们提出了一种用于BioEQA的序列标注方法,即多片段抽取设定。我们的方法直接处理以可变数量短语作为答案的问题,并能从训练数据中学习决定一个问题的答案数量。我们在BioASQ 7b和8b列表型问题上的实验结果优于性能最佳的现有模型,且无需后处理步骤。源代码和资源可在 https://github.com/dmis-lab/SeqTagQA 免费下载。

关键词

引用

@article{arxiv.2104.07535,
  title  = {Sequence tagging for biomedical extractive question answering},
  author = {Wonjin Yoon and Richard Jackson and Aron Lagerberg and Jaewoo Kang},
  journal= {arXiv preprint arXiv:2104.07535},
  year   = {2022}
}

备注

Published as "advanced access". Bioinformatics (2022). Supplementary data are available at Bioinformatics online