中文

基于面部肌肉运动可解释归因向量的口吃言语不流畅预测

计算机视觉与模式识别 2020-10-06 v1 神经元与认知

摘要

口吃等言语障碍会因声音和音节的 involuntary 重复、延长和阻塞而破坏正常的言语流畅性。除了这些对言语流畅性的破坏外,大多数成年口吃者(AWS)在口吃发生前、发生期间和发生后还会表现出许多可观察到的次级行为,通常涉及面部肌肉。近期研究已探索利用基于人工智能(AI)的算法,从言语发声过程中的呼吸频率、音频等自动检测口吃。然而,大多数方法需要受控环境和/或侵入式可穿戴传感器,且无法解释为何做出某一判定(流畅 vs 口吃)。我们假设,AWS 的言语前面部活动可通过非侵入方式捕获,其中含有足够信息以准确将即将发生的言语分类为流畅或口吃。为此,本文提出一种新颖的可解释 AI(XAI)辅助卷积神经网络(CNN)分类器,通过学习 AWS 的时间性面部肌肉运动模式来预测近未来口吃,并解释所涉及的重要面部肌肉与动作。统计分析显示,颊肌(p<0.005)和唇肌(p<0.005)在预测口吃上具有显著高发性,并表现出一种利于唤醒和说话预期的行为。对这些上、下面部肌肉的时间性研究可促进口吃的早期检测,推动口吃自动评估,并通过实时提供自动非侵入反馈而应用于行为疗法。

关键词

引用

@article{arxiv.2010.01231,
  title  = {Stuttering Speech Disfluency Prediction using Explainable Attribution Vectors of Facial Muscle Movements},
  author = {Arun Das and Jeffrey Mock and Henry Chacon and Farzan Irani and Edward Golob and Peyman Najafirad},
  journal= {arXiv preprint arXiv:2010.01231},
  year   = {2020}
}

备注

Submitting to IEEE Trans. 10 pages, 7 figures. Final Manuscript