中文

Wake Vision:面向 TinyML 计算机视觉应用的定制数据集与基准套件

计算机视觉与模式识别 2026-05-04 v6 人工智能

摘要

微型机器学习 (TinyML) 将模型与微控制器上的传感器协同部署,其中小型模型(对标签噪声异常敏感)和定制二元任务(缺乏标准基准)使得通用数据集实践难以适用。视觉唤醒词 (VWW) 作为先前的标准 TinyML 人员检测基准,包含约 12.3 万张图像,估计标签错误率为 7.8%,这限制了其在生产级系统中的实用性。然而,对于 TinyML 用例的规模和多样性而言,人工标注的成本过高。我们通过 Wake Vision 流水线填补了这一空白,这是一种为 TinyML 生成和策划大规模二元分类数据集的自动化方法。我们采用以数据为中心的 TinyML 方法进行数据集构建、筛选和生命周期管理,以生成这些系统所需的大型、高质量策划的数据集。该流水线结合了跨图像级和边界框源的标签融合、基于置信度/面积/表征的过滤、评估集上的标签校正,以及细粒度基准子集的自动生成。将其应用于人员检测,我们发布了 Wake Vision,一个包含近 600 万张图像的数据集(人员图像数量比 VWW 多近 100 倍),其重新人工标注的验证集和测试集的标签错误率为 2.2%。在 MobileNetV2、MCUNet、MicroNets 和 ColabNAS 架构上,基于 Wake Vision 训练的模型在测试准确率上比 VWW 最高提升了 6.6%,并在涵盖感知性别、感知年龄、距离、光照和表征的 16 个细粒度子集中的 13 个上匹配或超越了基于 VWW 训练的模型。在覆盖驾驶和俯视监控图像的三个分布外数据集上,该优势在分布偏移下依然保持。所有产物均通过 TensorFlow Datasets 和 Hugging Face 在 CC-BY 4.0 许可下发布。

关键词

引用

@article{arxiv.2405.00892,
  title  = {Wake Vision: A Tailored Dataset and Benchmark Suite for TinyML Computer Vision Applications},
  author = {Colby Banbury and Emil Njor and Andrea Mattia Garavagno and Mark Mazumder and Matthew Stewart and Pete Warden and Manjunath Kudlur and Nat Jeffries and Xenofon Fafoutis and Vijay Janapa Reddi},
  journal= {arXiv preprint arXiv:2405.00892},
  year   = {2026}
}