标签批评家:在模型之前设计数据
计算机视觉与模式识别
2024-11-06 v1
摘要
随着医学数据集的迅速扩展,创建不同身体结构的详细标注变得越来越昂贵和耗时。我们认为,要求放射科医生创建详细的标注是不必要的负担,并且预先存在的人工智能模型可以在很大程度上自动化这一过程。遵循“不要用牛刀杀鸡”的精神,我们发现,与其从头开始创建标注,放射科医生只需在最佳AI标签存在错误时进行审查和编辑。为了从多个AI标签中获得最佳AI标签,我们开发了一个名为“标签批评家”的自动工具,该工具可以通过不知疲倦的成对比较来评估标签质量。大量实验表明,当与我们开发的图像-提示对结合使用时,预先存在的、在自然图像和文本上训练的大型视觉语言模型(LVLM)在成对比较中选择最佳标签的准确率达到96.5%,而无需额外的微调。通过将手动标注任务(30-60分钟/扫描)转化为自动比较任务(15秒/扫描),我们有效地将放射科医生所需的手动工作量减少了一个数量级。当最佳AI标签足够准确时(取决于身体结构,准确率为81%),它们将被直接采用为数据集的金标准标注,而质量较低的AI标签将被自动丢弃。当没有其他标签可供比较时,标签批评家还可以以71.8%的准确率检查单个AI标签的标签质量,如果估计质量较低(取决于身体结构,占19%),则会提示放射科医生进行审查和编辑。
引用
@article{arxiv.2411.02753,
title = {Label Critic: Design Data Before Models},
author = {Pedro R. A. S. Bassi and Qilong Wu and Wenxuan Li and Sergio Decherchi and Andrea Cavalli and Alan Yuille and Zongwei Zhou},
journal= {arXiv preprint arXiv:2411.02753},
year = {2024}
}