TinyVQA:面向资源受限设备视觉问答的紧凑多模态深度神经网络
计算机视觉与模式识别
2024-04-05 v1 人工智能
机器学习
摘要
传统机器学习模型通常需要强大的硬件支持,使其不适合部署在资源受限的设备上。Tiny Machine Learning (tinyML) 已成为在这些设备上运行机器学习模型的一种有前景的方法,但由于复杂度、延迟和功耗的增加,将多种数据模态集成到 tinyML 模型中仍然是一个挑战。本文提出了 TinyVQA,一种用于视觉问答任务的新型多模态深度神经网络,可部署在资源受限的 tinyML 硬件上。TinyVQA 利用基于监督注意力的模型,学习如何使用视觉和语言模态来回答关于图像的问题。从基于监督注意力的 VQA 模型中蒸馏出的知识训练了内存感知的紧凑 TinyVQA 模型,并采用低位宽量化技术进一步压缩模型,以便部署在 tinyML 设备上。TinyVQA 模型在用于灾后损害评估的 FloodNet 数据集上进行了评估。该紧凑模型达到了 79.5% 的准确率,证明了 TinyVQA 在实际应用中的有效性。此外,该模型被部署在配备了 AI deck 和 GAP8 微处理器的 Crazyflie 2.0 无人机上。TinyVQA 模型在微型无人机上部署时实现了 56 ms 的低延迟并消耗 693 mW 的功率,展示了其对资源受限嵌入式系统的适用性。
引用
@article{arxiv.2404.03574,
title = {TinyVQA: Compact Multimodal Deep Neural Network for Visual Question Answering on Resource-Constrained Devices},
author = {Hasib-Al Rashid and Argho Sarkar and Aryya Gangopadhyay and Maryam Rahnemoonfar and Tinoosh Mohsenin},
journal= {arXiv preprint arXiv:2404.03574},
year = {2024}
}
备注
Accepted as a full paper by the tinyML Research Symposium 2024