BI-LAVA:通过主动学习与视觉分析进行层次化图像标注的生物策展
人机交互
2023-08-17 v1 机器学习
摘要
在生物医学领域,分类法以层次结构组织科学图像的采集模态。此类分类法利用大量正确的图像标签,并提供关于科学出版物重要性的关键信息,进而可用于生物策展任务。然而,标签的层次性、处理图像的开销、标注数据的缺失或不完整,以及标注此类数据所需的专业知识,阻碍了用于生物策展的有用数据集的创建。基于与生物策展者和文本挖掘研究者的多年合作,我们推导出一种迭代视觉分析与主动学习策略以应对这些挑战。我们在名为 BI-LAVA(通过主动学习与视觉分析进行层次化图像标注的生物策展)的系统中实现该策略。BI-LAVA 利用少量图像标签、一组层次化图像分类器以及主动学习,帮助模型构建者处理不完整的真值标签、面向层次化图像模态分类法,并对大量未标注图像进行分类。BI-LAVA 的前端使用自定义编码来表示数据分布、分类法、图像投影和图像缩略图的邻域,帮助模型构建者探索不熟悉的图像数据集与分类法,并修正和生成标签。一项与机器学习从业者的评估表明,我们的人机混合方法成功支持领域专家理解分类法中各类别的特征,以及验证并改进已标注与未标注集合中的数据质量。
引用
@article{arxiv.2308.08003,
title = {BI-LAVA: Biocuration with Hierarchical Image Labeling through Active Learning and Visual Analysis},
author = {Juan Trelles and Andrew Wentzel and William Berrios and G. Elisabeta Marai},
journal= {arXiv preprint arXiv:2308.08003},
year = {2023}
}
备注
15 pages, 6 figures