低质量训练数据对临床报告信息抽取的影响
机器学习
2021-09-21 v2 计算与语言
信息检索
摘要
在过去五年中,从临床文档中进行信息抽取的工作激增,即关于能够从日常临床实践中生成的非正式、非结构化文本中抽取出与该实践相关的概念提及的算法。此类文献大多基于监督学习的方法,即从人工标注样例训练信息抽取系统的方法。尽管大量工作致力于设计产生越来越准确的信息抽取器的学习方法,却无工作致力于研究训练数据质量对学习过程的影响。训练数据的低质量通常源于标注数据的人与必须依据其判断评估自动标注数据的人不同。本文中,我们测试了此类数据质量问题对应用于临床领域的信息抽取系统准确性的影响。为此,我们比较了由权威编码者(即同样标注了测试数据且我们必须遵从及其判断的编码者)标注的训练数据所得的准确性,与由另一编码者标注的训练数据所得的准确性。结果表明,尽管两名编码者间的不一致(在训练集上测得)相当大,但差异(令人惊讶地)并不总具有统计显著性。
引用
@article{arxiv.1502.05472,
title = {On the Effects of Low-Quality Training Data on Information Extraction from Clinical Reports},
author = {Diego Marcheggiani and Fabrizio Sebastiani},
journal= {arXiv preprint arXiv:1502.05472},
year = {2021}
}
备注
Submitted for publication