中文

通过实体感知掩码策略提升低资源生物医学问答

计算与语言 2021-02-17 v1 信息检索 机器学习

摘要

生物医学问答(QA)因能从海量科学文献中为用户提供高质量信息而受到越来越多的关注。尽管近期出现了越来越多生物医学 QA 数据集,但这些资源仍然相当有限且制作成本高昂。通过预训练语言模型(LMs)进行迁移学习已被证明是利用现有通用知识的一种有前景的方法。然而,微调这些大型模型可能代价高昂且耗时,在适配到专业领域特定主题(如 COVID-19 文献)时往往收益有限。为进一步提升其领域适配,我们提出了一种简单却未被探索的方法,称为生物医学实体感知掩码(BEM)。我们鼓励掩码语言模型基于表征当前领域的关键实体来学习以实体为中心的知识,并利用这些实体来驱动 LM 微调。所得策略是一种适用于多种掩码 LM 的下游过程,无需在神经架构中增加额外内存或组件。实验结果表明,在多个生物医学 QA 数据集上其性能与最先进模型相当。

关键词

引用

@article{arxiv.2102.08366,
  title  = {Boosting Low-Resource Biomedical QA via Entity-Aware Masking Strategies},
  author = {Gabriele Pergola and Elena Kochkina and Lin Gui and Maria Liakata and Yulan He},
  journal= {arXiv preprint arXiv:2102.08366},
  year   = {2021}
}

备注

EACL 2021 - Short Paper - European Chapter of the Association for Computational Linguistics