游戏化众包作为肺超声数据集标注的新方法
计算机与社会
2023-06-13 v1
摘要
研究目的:机器学习模型已推进医学图像处理并能产生更快、更准确的诊断。尽管有丰富的可用医学影像数据,用于模型训练的高质量标注数据仍然缺乏。我们研究了增强内置质量控制指标的游戏化众包平台是否能产生与临床专家相当的肺超声视频片段标注。方法:从203名患者回顾性收集2384个肺超声视频片段。六名肺超声专家将其中393个片段分类为无B线、一条或多条离散B线、或融合B线,以创建两组参考标准标注(195个训练集片段和198个测试集片段)。这些集合分别用于A)在游戏化众包平台上训练用户,和B)将所得众包标注的一致性与个别专家相对于参考标准的一致性进行比较。结果:在8天内从426名独立用户收集了关于2384个肺超声视频片段的99238条众包意见。在198个测试集片段上,个别专家相对于参考标准的平均标注一致性为85.0% ± 2.0(SEM),而众包标注一致性为87.9%(p=0.15)。当将个别专家意见与排除其自身意见多数投票创建的参考标准标注比较时,众包一致性高于个别专家相对于参考标准的平均一致性(87.4% 对比 80.8% ± 1.6;p<0.001)。结论:通过游戏化方法进行的B线分类众包标注达到了专家级质量。可扩展的高质量标注方法可能促进机器学习模型开发的训练数据集创建。
引用
@article{arxiv.2306.06773,
title = {Gamified Crowdsourcing as a Novel Approach to Lung Ultrasound Dataset Labeling},
author = {Nicole M Duggan and Mike Jin and Maria Alejandra Duran Mendicuti and Stephen Hallisey and Denie Bernier and Lauren A Selame and Ameneh Asgari-Targhi and Chanel E Fischetti and Ruben Lucassen and Anthony E Samir and Erik Duhaime+ and Tina Kapur and Andrew J Goldsmith},
journal= {arXiv preprint arXiv:2306.06773},
year = {2023}
}
备注
27 pages total