VisioFirm:面向计算机视觉的跨平台 AI 辅助标注工具
计算机视觉与模式识别
2025-09-05 v1 人工智能
摘要
AI 模型依赖标注数据来学习模式并进行预测。标注通常是一个劳动密集型步骤,需要关联从简单的分类标签到更复杂任务(如目标检测、有向边界框估计和实例分割)的标签。传统工具通常需要大量人工输入,限制了对大型数据集的可扩展性。为解决此问题,我们引入了 VisioFirm,一个开源 Web 应用,旨在通过 AI 辅助自动化来简化图像标注。VisioFirm 将 SOTA 基础模型集成到带有过滤流水线的界面中,以减少人在回路的工作量。这种混合方法采用 CLIP 结合预训练检测器(如 Ultralytics 模型)处理常见类别,并使用零样本模型(如 Grounding DINO)处理自定义标签,通过低置信度阈值生成初始标注以最大化召回率。通过该框架,在 COCO 类型类别上进行测试时,初始预测已被证明大部分正确,尽管用户可以通过支持边界框、有向边界框和多边形的交互式工具对其进行细化。此外,VisioFirm 具有由 Segment Anything 驱动的即时分割功能,并通过 WebGPU 加速以提高浏览器端效率。该工具支持多种导出格式(YOLO、COCO、Pascal VOC、CSV),并在模型缓存后可离线运行,增强了可访问性。通过在多样数据集上的基准测试,VisioFirm 展示了高达 90% 的人工工作量减少,同时通过连接基于 CLIP 的消歧组件聚类和用于冗余检测抑制的 IoU 图保持高标注准确率。VisioFirm 可从 \href{https://github.com/OschAI/VisioFirm}{https://github.com/OschAI/VisioFirm} 获取。
引用
@article{arxiv.2509.04180,
title = {VisioFirm: Cross-Platform AI-assisted Annotation Tool for Computer Vision},
author = {Safouane El Ghazouali and Umberto Michelucci},
journal= {arXiv preprint arXiv:2509.04180},
year = {2025}
}