视觉唤醒词数据集
计算机视觉与模式识别
2019-06-14 v1 图像与视频处理
摘要
物联网 (IoT) 应用的兴起需要在边缘具备智能。微控制器提供了一种低成本计算平台,可使用机器学习大规模部署智能 IoT 应用,但其片上内存与计算能力极为有限。为在此类设备上部署计算机视觉,我们需要微小的视觉模型,其峰值内存占用与设备存储上的模型大小均在几百千字节以内。为促进对微控制器友好型模型的开发,我们提出一个新数据集 Visual Wake Words,其代表了识别图像中是否有人存在的常见微控制器视觉用例,并为微小视觉模型提供了现实的基准。在 250 KB 的有限内存占用内,若干最先进的移动模型在 Visual Wake Words 数据集上达到了 85-90% 的准确率。我们预期所提出的数据集将推动微小视觉模型的研究,从而在微控制器应用的准确率与内存占用方面推进帕累托最优边界。
引用
@article{arxiv.1906.05721,
title = {Visual Wake Words Dataset},
author = {Aakanksha Chowdhery and Pete Warden and Jonathon Shlens and Andrew Howard and Rocky Rhodes},
journal= {arXiv preprint arXiv:1906.05721},
year = {2019}
}
备注
10 pages, 4 figures