Pl@ntNet人工智能算法的协作学习:工作原理与改进方法
机器学习
2024-06-06 v1 应用统计
摘要
用于植物物种识别的深度学习模型依赖于大型标注数据集。PlantNet系统允许用户上传和标注植物观察记录,从而实现全球数据收集,但由于用户技能多样,导致标签噪声。达成共识对于训练至关重要,但收集数据的庞大规模使得传统的标签聚合策略面临挑战。现有方法要么保留所有观察记录,导致训练数据有噪声;要么选择性地保留那些有足够投票的记录,从而丢弃有价值的信息。此外,由于许多物种很少被观察到,用户专业知识无法通过用户间一致性来评估:否则,植物学专家在AI训练步骤中的权重将低于普通用户。我们提出的标签聚合策略旨在协作训练植物识别AI模型。该策略根据用户从众包数据中识别植物物种的能力,将用户专业知识估计为每个用户的信任分数。信任分数根据当前估计标签下正确识别的物种进行递归估计。这个可解释的分数利用了植物学专家的知识和用户的异质性。随后,我们的策略移除不可靠的观察记录,但保留那些具有有限可信标注的记录,这与其他方法不同。我们在PlantNet数据库的一个大型子集上评估了PlantNet的策略,该子集专注于欧洲植物区系,包含超过600万条观察记录和80万用户。我们证明,基于用户专业知识的多样性来估计用户技能可以提高标注性能。我们的发现强调了人工标注和数据过滤在改进AI性能以优化数据集方面的协同作用。我们探索了将基于AI的投票与人工输入相结合。这可以进一步增强人机交互,以检测不可靠的观察记录。
引用
@article{arxiv.2406.03356,
title = {Cooperative learning of Pl@ntNet's Artificial Intelligence algorithm: how does it work and how can we improve it?},
author = {Tanguy Lefort and Antoine Affouard and Benjamin Charlier and Jean-Christophe Lombardo and Mathias Chouet and Hervé Goëau and Joseph Salmon and Pierre Bonnet and Alexis Joly},
journal= {arXiv preprint arXiv:2406.03356},
year = {2024}
}