中文

医学文本的小样本学习:一项系统综述

计算与语言 2022-05-02 v1 机器学习

摘要

目的:小样本学习(FSL)方法在训练时仅需少量标注样本。由于许多医学主题在实际环境中标注文本数据有限,基于FSL的自然语言处理(NLP)方法具有巨大潜力。我们旨在开展一项系统综述,以探究用于医学NLP的FSL方法现状。材料与方法:我们检索了2016年1月至2021年8月期间发表于PubMed/Medline、Embase、ACL Anthology和IEEE Xplore Digital Library的文章。为识别最新相关方法,我们还通过Google Scholar检索了预印本服务器(如medRxiv)等其他来源。我们纳入了所有涉及FSL及任意类型医学文本的文章。我们基于数据来源、目标、训练集规模、主要方法/途径和评估方法对文章进行摘录。结果:31项研究符合纳入标准——均发表于2018年之后;其中22项(71%)自2020年起。概念抽取/命名实体识别是最常被处理的任务(13/31;42%),其次是文本分类(10/31;32%)。21项(68%)研究重构现有数据集以合成方式创建小样本场景,MIMIC-III是最常用数据集(7/31;23%)。常用方法包括带注意力机制的FSL(12/31;39%)、原型网络(8/31;26%)和元学习(6/31;19%)。讨论:尽管FSL在生物医学NLP中具潜力,但其进展相较于领域无关的FSL仍有限。这可能是由于缺乏标准化公共数据集,以及FSL方法在生物医学主题上相对表现不佳。创建并发布面向生物医学FSL的专用数据集可通过支持对比分析来促进方法发展。

关键词

引用

@article{arxiv.2204.14081,
  title  = {Few-shot learning for medical text: A systematic review},
  author = {Yao Ge and Yuting Guo and Yuan-Chi Yang and Mohammed Ali Al-Garadi and Abeed Sarker},
  journal= {arXiv preprint arXiv:2204.14081},
  year   = {2022}
}