中文

口面部评估视频的自动时间分割

计算机视觉与模式识别 2022-08-24 v1 信号处理

摘要

计算机视觉技术有助于自动化或部分自动化口面部功能障碍的临床检查,从而提供准确且客观的评估。为开发此类自动化系统,我们评估了两种方法来检测口面部评估视频中的重复动作并进行时间分割(解析)。来自 Toronto NeuroFace 数据集的肌萎缩侧索硬化症(ALS)参与者与健康对照(HC)个体的录像被用作实验数据。我们考察了两种用于重复检测与解析的方法:一种基于跟踪面部特征点得到的工程化特征,并对上唇与下唇的朱红-皮肤交界处之间的距离进行峰值检测(基线分析);另一种使用名为 RepNet(Dwibedi 等人,2020)的预训练基于 transformer 的深度学习模型,该模型可自动检测周期性,并解析视频数据中的周期性与半周期性重复。在两个口面部评估任务——重复最大张口(OPEN)和重复句子“Buy Bobby a Puppy”(BBP)——的实验评估中,RepNet 相比基于特征点的方法提供了更好的解析效果,其相对于人工标注真值解析的平均交并比(IoU)更高。基于 RepNet 的自动解析还能根据 BBP 重复的持续时间清晰区分 HC 与 ALS 参与者,而基于特征点的方法则无法做到。

关键词

引用

@article{arxiv.2208.10591,
  title  = {Automated Temporal Segmentation of Orofacial Assessment Videos},
  author = {Saeid Alavi Naeini and Leif Simmatis and Deniz Jafari and Diego L. Guarin and Yana Yunusova and Babak Taati},
  journal= {arXiv preprint arXiv:2208.10591},
  year   = {2022}
}

备注

2022 IEEE EMBS International Conference on Biomedical & Health Informatics (BHI)