Label-Assemble:利用具有部分标签的多个数据集
计算机视觉与模式识别
2023-05-16 v4 人工智能
摘要
深度学习的成功严重依赖于大规模标注数据集,但我们往往只能访问到若干个带有部分标签的小数据集。为解决该问题,我们提出了一项新倡议“Label-Assemble”,旨在释放来自多个公共数据集组装的部分标签的全部潜力。我们发现,从负例学习有助于计算机辅助疾病诊断与检测。这一发现在新疾病诊断中尤为关键,因为正例难以收集,而负例相对更容易组装。例如,组装来自NIH ChestX-ray14(自2017年起可用)的现有标签将COVID-19诊断准确率从96.3%显著提升至99.3%。除诊断外,组装标签还能改善疾病检测,例如胰腺导管腺癌(PDAC)的检测可大幅受益于利用Cysts和PanNets(另两类胰腺异常)的标签,在保持98.0%高特异性的同时将灵敏度从52.1%提升至84.0%。
引用
@article{arxiv.2109.12265,
title = {Label-Assemble: Leveraging Multiple Datasets with Partial Labels},
author = {Mintong Kang and Bowen Li and Zengle Zhu and Yongyi Lu and Elliot K. Fishman and Alan L. Yuille and Zongwei Zhou},
journal= {arXiv preprint arXiv:2109.12265},
year = {2023}
}
备注
ISBI 2023