构建人工数据用于低资源生物医学文本标注微调及在PICO标注中的应用
计算与语言
2020-01-16 v3 机器学习
机器学习
摘要
生物医学文本标注系统深受标注训练数据匮乏的困扰。近来已有利用预训练编码器应对此问题的尝试。预训练编码器提供输入文本的表示,随后将其输入任务特定的层进行分类。整个网络在来自目标任务的标注数据上微调。遗憾的是,低资源生物医学任务通常仅有过少标注实例以供满意的微调。此外,若标签空间较大,则大多数标签含有极少或无标注实例。多数生物医学标注系统将标签视为索引,忽略了这些标签常为自然语言所表达的概念(例如“脑成像中病变的出现”)。为解决这些问题,我们提出使用标签文本(即标签名称)作为输入对应标签索引(即标签的索引)来构建额外的标注实例。事实上,我们提出了多种从单个标签制造多个 artificial 标注实例的策略。随后网络在真实数据与这些新构建的人工标注实例的组合上微调。我们在一个重要的低资源生物医学任务——称为PICO标注(要求用对应于试验不同方面的标签,即试验的PICO(人群、干预/对照、结局)特征,来标注描述临床试验的原始文本)——上评估所提方法。我们的实证结果表明,所提方法在PICO标注上达到了新的SOTA性能,相较竞争基线有非常显著的提升。
引用
@article{arxiv.1910.09255,
title = {Constructing Artificial Data for Fine-tuning for Low-Resource Biomedical Text Tagging with Applications in PICO Annotation},
author = {Gaurav Singh and Zahra Sabet and John Shawe-Taylor and James Thomas},
journal= {arXiv preprint arXiv:1910.09255},
year = {2020}
}
备注
International Workshop on Health Intelligence (W3PHIAI-20); AAAI-20