中文

面向低功耗边缘平台的实时多模态嵌入式视觉框架:用于目标检测、面部情绪识别与生物特征识别

计算机视觉与模式识别 2026-01-21 v1

摘要

智能监控系统通常独立处理目标检测、面部识别和情绪分析等感知任务,但缺乏一个统一的、自适应的运行时调度器,该调度器能根据上下文触发条件动态分配计算资源。这限制了它们在低功耗边缘设备上的整体理解和效率。为了解决这个问题,我们提出了一个实时多模态视觉框架,该框架将目标检测、特定人员面部识别和情绪检测集成到一个统一管道中,并部署在Raspberry Pi 5边缘平台上。我们系统的核心是一个自适应调度机制,通过选择性地激活模块,例如用于目标检测的YOLOv8n、用于面部识别的基于FaceNet的自定义嵌入系统以及用于情绪分类的DeepFace的CNN,与连续处理相比,计算负载降低了65%。实验结果证明了该系统的有效性,目标检测模块的平均精度(AP)达到0.861,面部识别准确率达到88%,情绪检测显示出强大的判别能力(特定情绪的AUC高达0.97),同时以每秒5.6帧的速度运行。我们的工作表明,上下文感知调度是在经济高效的边缘硬件上解锁复杂多模态AI的关键,使智能感知更易获取且更具隐私保护性。

关键词

引用

@article{arxiv.2601.11970,
  title  = {Real-Time Multi-Modal Embedded Vision Framework for Object Detection Facial Emotion Recognition and Biometric Identification on Low-Power Edge Platforms},
  author = {S. M. Khalid Bin Zahid and Md. Rakibul Hasan Nishat and Abdul Hasib and Md. Rakibul Hasan and Md. Ashiqussalehin and Md. Sahadat Hossen Sajib and A. S. M. Ahsanul Sarkar Akib},
  journal= {arXiv preprint arXiv:2601.11970},
  year   = {2026}
}