中文

面向多类恶性度预测的合成采样

机器学习 2018-07-10 v1 计算机视觉与模式识别 机器学习

摘要

我们探讨了针对不平衡多标签分类问题的若干过采样技术,这一设定在开发计算机辅助诊断(CADx)系统模型时经常遇到。尽管大多数CADx系统旨在优化分类器整体准确率而不考虑各类的相对分布,我们研究了使用合成采样在预测恶性程度时提升每类性能。利用低级图像特征和随机森林分类器,我们表明使用合成过采样技术使少数类的灵敏度平均提升7.22个百分点,其中某一特定少数类的灵敏度提升高达19.88个百分点。此外,对合成结节的低级图像特征分布分析表明,这些结节可为了解如何预处理图像数据以获得更好分类性能,或在可行时如何通过补充原始数据集提供见解。

关键词

引用

@article{arxiv.1807.02608,
  title  = {Synthetic Sampling for Multi-Class Malignancy Prediction},
  author = {Matthew Yung and Eli T. Brown and Alexander Rasin and Jacob D. Furst and Daniela S. Raicu},
  journal= {arXiv preprint arXiv:1807.02608},
  year   = {2018}
}

备注

5 pages, 3 figures, 4 Tables, KDD MLMH'18 Workshop