BioADAPT-MRC:基于对抗学习的域自适应改进生物医学机器阅读理解任务
摘要
生物医学机器阅读理解(biomedical-MRC)旨在理解复杂的生物医学叙述,并辅助医疗专业人员从中检索信息。现代基于神经网络的 MRC 系统的高性能依赖于高质量、大规模、人工标注的训练数据集。在生物医学领域,构建此类数据集的一个关键挑战在于对领域知识的要求,这导致了标注数据的稀缺,以及从已标注的通用(源)域向生物医学(目标)域进行迁移学习的必要。然而,由于主题差异,通用域与生物医学域之间的边缘分布存在偏差。因此,将基于通用域训练的模型所学到的表示直接迁移到生物医学域会损害模型性能。我们提出了一种用于生物医学机器阅读理解任务的基于对抗学习的域自适应框架(BioADAPT-MRC),这是一种基于神经网络的方法,用于解决通用与生物医学域数据集之间边缘分布的偏差。BioADAPT-MRC 放宽了为训练一个表现良好的生物医学-MRC 模型而生成伪标签的需求。我们在三个广泛使用的基准生物医学-MRC 数据集——BioASQ-7b、BioASQ-8b 和 BioASQ-9b——上将 BioADAPT-MRC 与现有最优方法进行比较,对其性能进行了充分评估。我们的结果表明,在不使用任何来自生物医学领域的合成或人工标注数据的情况下,BioADAPT-MRC 在这些数据集上均可达到最先进(state-of-the-art, SOTA)性能。可用性:BioADAPT-MRC 作为开源项目免费提供,地址为 \url{https://github.com/mmahbub/BioADAPT-MRC}。
引用
@article{arxiv.2202.13174,
title = {BioADAPT-MRC: Adversarial Learning-based Domain Adaptation Improves Biomedical Machine Reading Comprehension Task},
author = {Maria Mahbub and Sudarshan Srinivasan and Edmon Begoli and Gregory D Peterson},
journal= {arXiv preprint arXiv:2202.13174},
year = {2022}
}
备注
31 pages, 9 figures. This is the Authors' Original Version of the article, which has been accepted for publication in Bioinformatics 2022