中文

基于 TF-IDF 特征的病理报告自动分类

计算与语言 2019-03-19 v1 机器学习 机器学习

摘要

病理报告可以说是医学中最重要的文件之一,包含关于患者活检样本视觉发现的解释性信息。每份病理报告在患者治疗后保留长达 20 年。世界各地的癌症登记处处理并编码大量的自由文本病理报告,以监测癌症和肿瘤疾病。尽管病理报告含有极有价值的信息,它们并未以任何系统化的方式用于促进计算病理学。因此,在本研究中,我们调查自动化机器学习技术,以从病理报告中识别/预测主要诊断(基于 ICD-O 编码)。我们通过从报告中提取 TF-IDF 特征并使用三种不同方法——SVM、XGBoost 和 Logistic Regression 进行分类来进行实验。我们构建了一个新数据集,包含 1,949 份病理报告,划分为 37 个 ICD-O 类别,收集自四个不同的原发部位,即肺、肾、胸腺和睾丸。这些报告是从 NCI Genomic Data Commons 公共数据集以 PDF 文件收集后手动转录为文本格式。我们随后通过移除 OCR 软件产生的不相关文本伪影对报告进行预处理。我们使用 XGBoost 分类器在 TF-IDF 特征向量上达到的最高分类准确率为 92\%,线性 SVM 的准确率为 87\%。此外,研究表明 TF-IDF 向量适用于突出报告中的重要关键词,这有助于癌症研究和诊断流程。结果令人鼓舞,展示了机器学习方法用于病理报告分类和编码的潜力。

关键词

引用

@article{arxiv.1903.07406,
  title  = {Automatic Classification of Pathology Reports using TF-IDF Features},
  author = {Shivam Kalra and Larry Li and Hamid R. Tizhoosh},
  journal= {arXiv preprint arXiv:1903.07406},
  year   = {2019}
}