中文

多模态生物医学数据挖掘中基于可靠性的归纳保角预测噪声训练标签清洗

机器学习 2023-09-15 v1 人工智能 计算机视觉与模式识别 基因组学 定量方法 应用统计 机器学习

摘要

准确标注生物医学数据是一项挑战。传统的半监督学习方法往往未能充分利用可用的未标注数据。为此,我们提出了一种新颖的基于可靠性的训练数据清洗方法,采用归纳保角预测(ICP)。该方法利用一小部分准确标注的训练数据,并借助 ICP 计算的可靠性指标,来纠正海量噪声训练数据中的错误标注数据与离群点。该方法的效力在三种不同模态的分类任务中得到验证:利用标题与摘要筛选药物性肝损伤(DILI)文献、通过 CT 放射组学与电子健康记录预测 COVID-19 患者的 ICU 入院情况,以及使用 RNA 测序数据对乳腺癌进行亚型分类。我们通过标签置换向训练标签引入不同程度的噪声。结果显示分类性能显著提升:在 96 项 DILI 实验中有 86 项准确率提升(最高达 11.4%),在全部 48 项 COVID-19 实验中 AUROC 与 AUPRC 均提升(最高达 23.8% 与 69.8%),在 48 项 RNA 测序实验中有 47 项准确率与宏平均 F1 分数提高(最高达 74.6% 与 89.0%)。我们的方法有望大幅提升多模态生物医学机器学习任务中的分类性能。重要的是,它无需大量精心整理的训练数据即可实现这一点。

关键词

引用

@article{arxiv.2309.07332,
  title  = {Reliability-based cleaning of noisy training labels with inductive conformal prediction in multi-modal biomedical data mining},
  author = {Xianghao Zhan and Qinmei Xu and Yuanning Zheng and Guangming Lu and Olivier Gevaert},
  journal= {arXiv preprint arXiv:2309.07332},
  year   = {2023}
}