从问答论坛生成生物医学问答语料库
信息检索
2020-12-23 v2
摘要
问答(QA)是一项旨在获取用户问题相关答案的自然语言处理任务。尽管该领域已取得一定进展,由于领域复杂性及训练集有限,生物医学问题对多数 QA 方法仍是挑战。我们提出一种从问答网络论坛自动抽取问题-文章对的方法,可用于文档检索——多数 QA 系统的关键步骤。所提框架从选定论坛抽取含引用的提问及对应回答。由此,基于文档检索的 QA 系统可利用这些论坛用户标注的问题-文章对进行开发与评估。我们将框架应用于三个论坛生成 BiQA 语料库,获得 7,453 个问题与 14,239 个问答-文章对。我们评估了与每问题关联的文档数及每回答投票数如何影响基线文档检索方法性能。此外,我们证明作为答案给出的文章与问题显著相似,并训练了一个取得与专家手动标注数据集相近性能的 SOTA 深度学习模型。所提框架可用于从这些论坛随新帖发布更新 BiQA 语料库,也可用于其他以文档支撑回答的论坛。BiQA 语料库及生成框架见 \url{https://github.com/lasigeBioTM/BiQA}。
引用
@article{arxiv.2002.02375,
title = {Generating Biomedical Question Answering Corpora from Q&A forums},
author = {Andre Lamurias and Diana Sousa and Francisco M. Couto},
journal= {arXiv preprint arXiv:2002.02375},
year = {2020}
}