从患者文本中识别医学症状:一种面向长尾多标签分布的主动学习方法
计算与语言
2021-03-30 v2 机器学习
摘要
我们研究从患者文本中识别医学症状的问题,以用于从患者处收集相关信息(即病史采集)。典型的患者文本通常描述患者正在经历的症状,且此类文本的单一样本可被标注多个症状。这使得医学症状识别器的学习具有挑战性,原因在于i)缺乏大量标注数据,以及ii)单文本可映射的多种症状构成庞大未知空间。此外,患者文本常表现为数据中的长尾分布(即某些标签/症状出现频率高于其他,例如“发热”与“便血”)。本文引入一种主动学习方法,利用持续精炼的已学习潜空间的基础结构来选择信息量最大的样本进行标注。这使得尽管数据分布存在长尾,仍可选择信息量最大的样本,通过已学习模型逐步扩大症状空间的覆盖。
引用
@article{arxiv.2011.06874,
title = {Medical symptom recognition from patient text: An active learning approach for long-tailed multilabel distributions},
author = {Ali Mottaghi and Prathusha K Sarma and Xavier Amatriain and Serena Yeung and Anitha Kannan},
journal= {arXiv preprint arXiv:2011.06874},
year = {2021}
}