中文

监督训练何时才有益?视觉语言模型时代目标检测的隐藏经济学

计算机视觉与模式识别 2025-10-21 v2 人工智能 机器学习

摘要

目标检测传统上依赖于高成本的手动标注。我们首次进行监督 YOLO 和零样本视觉语言模型(Gemini Flash 2.5 和 GPT-4)的全面成本效益分析。评估在 5000 张分层抽样的 COCO 图像和 500 张多样化产品图像上进行,并结合总拥有成本(TCO)建模,推导出架构选择的盈亏平衡阈值。结果显示,监督 YOLO 在标准类别上达到 91.2% 的准确率,而 Gemini 和 GPT-4 分别为 68.5% 和 71.3%;100 类别系统的标注费用为 10,800 美元,准确率优势仅在超过 5500 万次推理后才显现(每年 15.1 万张图像每天)。在多样化产品类别上,Gemini 实现 52.3%,GPT-4 55.1%,而监督 YOLO 无法检测未训练的类别。按 10 万次推理计算,Gemini 和 GPT-4 的正确检测成本分别为 0.00050 美元和 0.00067 美元,而 YOLO 为 0.143 美元。我们提供决策框架,表明最优架构选择取决于推理量、类别稳定性、预算和准确率要求。

关键词

引用

@article{arxiv.2510.11302,
  title  = {When Does Supervised Training Pay Off? The Hidden Economics of Object Detection in the Era of Vision-Language Models},
  author = {Samer Al-Hamadani},
  journal= {arXiv preprint arXiv:2510.11302},
  year   = {2025}
}

备注

30 pages, 12 figures, 4 tables