中文

一种利用MLP混合器和手工特征的深度学习网络进行人脸神经痛检测的多模态融合模型

计算机视觉与模式识别 2025-03-14 v1 人工智能 机器学习

摘要

人脸神经痛的算法检测有望改进当前实践,后者通常涉及医生进行的耗时且主观的评估。本文提出一种基于多模态融合的深度学习模型,该模型利用基于MLP混合器的模型处理非结构化数据(即RGB图像或带人脸线条段的图像),并使用前馈神经网络处理结构化数据(即人脸关键点坐标、面部表情特征或手工特征),用于检测人脸神经痛。我们贡献了一个研究,分析了不同数据模态及多模态融合方法的效果,使用20例面部神经痛患者和20例健康受试者的视频。我们的多模态融合模型达到了96.00的F1分数,显著高于仅使用手工特征训练的前馈神经网络(82.80 F1)和仅使用原始RGB图像训练的MLP混合器模型(89.00 F1)。

关键词

引用

@article{arxiv.2503.10371,
  title  = {A Multimodal Fusion Model Leveraging MLP Mixer and Handcrafted Features-based Deep Learning Networks for Facial Palsy Detection},
  author = {Heng Yim Nicole Oo and Min Hun Lee and Jeong Hoon Lim},
  journal= {arXiv preprint arXiv:2503.10371},
  year   = {2025}
}

备注

PAKDD 2025. arXiv admin note: text overlap with arXiv:2405.16496