利用富集标注从有限标注数据的病理报告中分类肿瘤属性
计算与语言
2020-12-16 v1 机器学习
摘要
精准医疗有潜力彻底改变医疗保健,但患者的大量数据被锁在非结构化自由文本中,限制了研究以及有效个性化治疗的实施。为临床笔记的信息抽取生成大型标注数据集通常具有挑战性且成本高昂,因为高质量标注需要高度的专业知识。为使自然语言处理能够适用于小数据集规模,我们开发了一种新颖的富集层次化标注方案与算法——监督式行注意力(Supervised Line Attention, SLA),并将该算法应用于预测加州大学旧金山分校(UCSF)肾癌与结肠癌病理报告中的分类肿瘤属性。此前的工作仅标注文档级标签,我们额外要求标注者在传统标签基础上进行富集,即要求其同时高亮与最终标签相关的行或可能的多行,这导致每篇文档所需标注时间增加20%。利用富集标注,我们开发了一种简单且可解释的机器学习算法,先预测文档中的相关行,再预测肿瘤属性。我们的结果表明,在每类癌症32、64、128和186篇标注文档的小数据集规模下,在绝大多数对比中,SLA仅需最先进方法一半数量的标注文档即可达到相似或更优的 micro-f1 与 macro-f1 分数。考虑到增加的标注时间,这相比最先进方法总共减少了40%的标注时间。
引用
@article{arxiv.2012.08113,
title = {Enriched Annotations for Tumor Attribute Classification from Pathology Reports with Limited Labeled Data},
author = {Nick Altieri and Briton Park and Mara Olson and John DeNero and Anobel Odisho and Bin Yu},
journal= {arXiv preprint arXiv:2012.08113},
year = {2020}
}