通过基于置信度的流程提高标本图像数据集自动标注的准确率
计算机视觉与模式识别
2024-11-25 v2 种群与进化
摘要
过去三十年间自然历史藏品的数字化解锁了大量标本图像和元数据宝库。人们非常有兴趣通过进一步标注额外的性状数据使这些数据更有用,利用卷积神经网络 (CNN) 等现代深度学习机器学习技术显示出特别的前景,能够减少人工专家所需的手动标注量,使该过程更快、更廉价。然而,在大多数情况下,这些方法的准确率太低,无法可靠地利用自动标注,通常在 80-85% 准确率范围内。本文提出并验证了一种能大幅提高该准确率的方法,其核心在于检查网络对生成标签的置信度,并利用用户定义的阈值拒绝低于所选水平的标签。我们证明了一个初始准确率为 86% 的朴素模型,通过选择更高的置信度阈值,可以达到 95% 以上的准确率(拒绝约 40% 的标签)或 99% 以上的准确率(拒绝约 65% 的标签)。这为将现有模型适配到各类研究的统计需求提供了灵活性,并有潜力将这些自动标注方法从不可用的不准确转变为宝贵的新工具。在以多种方式验证该方法后,我们标注了一个包含 600,000 多份植物标本的大型数据集的生殖状态。结果分析指向了未被充分研究的相关性,以及与已知趋势的总体一致性。通过随本工作共享这一新数据集,我们希望让生态学家能够在其选定的准确率/覆盖率权衡点上,为自己的研究问题获取见解。
引用
@article{arxiv.2411.10074,
title = {Improving the accuracy of automated labeling of specimen images datasets via a confidence-based process},
author = {Quentin Bateux and Jonathan Koss and Patrick W. Sweeney and Erika Edwards and Nelson Rios and Aaron M. Dollar},
journal= {arXiv preprint arXiv:2411.10074},
year = {2024}
}