中文

临床试验文本中的数据挖掘:用于分类与问答任务的 Transformer

计算与语言 2020-01-31 v1 机器学习

摘要

这项关于数据提取方法的研究将自然语言处理的最新进展应用于基于医学文献的证据合成。感兴趣文本包括英语及多语言环境下的临床试验摘要。主要关注通过人口、干预、比较者与结果(PICO)框架表征的信息,但数据提取不限于这些字段。基于 transformer 的近期神经网络架构展现出迁移学习能力,并在下游自然语言处理任务(如通用阅读理解)上性能提升,这由该架构对上下文化词嵌入与自注意力机制的使用所带来。本文有助于解决 PICO 句子预测任务中歧义相关问题,并强调用于训练命名实体识别系统的标注如何被用于训练一个高性能但灵活的系统综述自动化问答架构。此外,它展示了如何通过增强来解决 PICO 实体提取训练标注不足的问题。本文中所有模型均以支持系统综述(半)自动化为目标创建。它们取得了高 F1 分数,并证明了应用基于 transformer 的分类方法支持生物医学文献数据挖掘的可行性。

关键词

引用

@article{arxiv.2001.11268,
  title  = {Data Mining in Clinical Trial Text: Transformers for Classification and Question Answering Tasks},
  author = {Lena Schmidt and Julie Weeds and Julian P. T. Higgins},
  journal= {arXiv preprint arXiv:2001.11268},
  year   = {2020}
}