中文

3DPalsyNet:基于全三维卷积神经网络的面部瘫痪分级与运动识别框架

计算机视觉与模式识别 2019-07-30 v1 人工智能 图形学 机器学习 神经与进化计算

摘要

从视频序列中进行面部分析的能力在生活的许多领域具有显著的正面影响潜力。其中一个领域涉及医学领域, specifically 用于辅助面部瘫痪患者的诊断与康复。考虑到此应用,本文提出了一个名为 3DPalsyNet 的端到端框架,用于口部运动识别与面部瘫痪分级任务。3DPalsyNet 利用带有 ResNet 骨干网络的 3D CNN 架构来预测这些动态任务。通过迁移在 Kinetics 数据集上预训练用于通用动作识别的 3D CNN 所学特征,该模型被改进以采用基于中心损失与 softmax 损失的联合监督学习。3DPalsyNet 在一个由具有不同程度面部瘫痪与口部运动的个体组成的测试集上进行评估,结果显示在这些任务上分别取得了 82% 和 86% 的颇具吸引力的分类准确率。本文研究了帧时长与损失函数的影响对提出的 3DPalsyNet 预测质量的作用,发现较短的 8 帧时长在此特定任务中表现最佳。中心损失与 softmax 相较于单独使用 softmax 损失,在时空特征学习上表现出改进,这与早期涉及空间域的工作一致。

关键词

引用

@article{arxiv.1905.13607,
  title  = {3DPalsyNet: A Facial Palsy Grading and Motion Recognition Framework using Fully 3D Convolutional Neural Networks},
  author = {Gary Storey and Richard Jiang and Shelagh Keogh and Ahmed Bouridane and Chang-Tsun Li},
  journal= {arXiv preprint arXiv:1905.13607},
  year   = {2019}
}