探索基于多模态融合的深度学习网络用于面瘫检测
计算机视觉与模式识别
2025-03-14 v2 人工智能
机器学习
摘要
面瘫的算法检测有望改善当前通常由临床医生进行劳动密集型和主观评估的实践。在本文中,我们提出了一种基于多模态融合的深度学习模型,该模型利用非结构化数据(即带有面部线段图像帧)和结构化数据(即面部表情特征)来检测面瘫。然后,我们贡献了一项研究,分析不同数据模态的效果以及基于多模态融合的方法的优势,使用了21名面瘫患者的视频。我们的实验结果表明,在各种数据模态(即非结构化数据 - RGB图像和面部线段图像,以及结构化数据 - 面部标志点坐标和面部表情特征)中,使用面部表情特征的前馈神经网络达到了76.22的最高精确率,而基于ResNet的使用面部线段图像的模型达到了83.47的最高召回率。当我们同时利用面部线段图像和面部表情特征时,我们的基于多模态融合的深度学习模型将精确率略微提高到77.05,但以召回率下降为代价。
引用
@article{arxiv.2405.16496,
title = {Exploring a Multimodal Fusion-based Deep Learning Network for Detecting Facial Palsy},
author = {Heng Yim Nicole Oo and Min Hun Lee and Jeong Hoon Lim},
journal= {arXiv preprint arXiv:2405.16496},
year = {2025}
}
备注
IJCAI 2024 4th AI for Ageless Aging Workshop (AIAA)