利用医师参与的自动化数据编程生成弱标签
机器学习
2024-07-12 v1
摘要
大型深度神经网络 (DNN) 通常数据需求量大,需要大量高质量标签数据才能收敛。这在医学领域是一个挑战,因为高质量标签数据往往稀缺。数据编程因此成为一种希望之光,它允许使用多个弱标签函数对未标记数据进行标记。这些函数通常由领域专家提供。数据编程可以将多个弱标签函数组合在一起,比简单对不同函数进行多数投票所得的标签更好。然而,在高维场景(如图像和时间序列数据)中,表达这些弱标签函数并不直接。我们在本文中提出一种方法,通过距离函数来绕过这一问题。在高维空间中,使用距离度量可以跨越不同标记任务进行泛化。我们提出一种算法,查询专家对数据集的几个代表性样本进行标记。这些样本由算法仔细选择,以捕获数据集的分布。对代表性子集上专家分配的标签可在整个数据集上诱导标记,从而生成用于数据编程管道的弱标签。在我们的医学时间序列案例研究中,对 3265 个样本中的 50 到 130 个样本进行标记可提高准确率 17-28%,F1 分数提高 13-28%。在我们的医学图像案例研究中,对 6293 个未标记医学图像中约 50 到 120 张图像进行标记,我们的方法相对于基线方法 Snuba 的准确率提高约 5-15%,F1 分数提高 12-19%。
引用
@article{arxiv.2407.07982,
title = {Automating Weak Label Generation for Data Programming with Clinicians in the Loop},
author = {Jean Park and Sydney Pugh and Kaustubh Sridhar and Mengyu Liu and Navish Yarna and Ramneet Kaur and Souradeep Dutta and Elena Bernardis and Oleg Sokolsky and Insup Lee},
journal= {arXiv preprint arXiv:2407.07982},
year = {2024}
}