中文

全注意力且可解释:用于疼痛检测的视觉与视频视觉 transformers

计算机视觉与模式识别 2022-10-31 v1

摘要

疼痛是全球性且代价高昂的问题,但要治疗必先检测。视觉 transformers 是计算机视觉中性能顶尖的架构,但关于其用于疼痛检测的研究甚少。本文提出首个全注意力自动疼痛检测流程,在基于面部表情的二分类疼痛检测上达到最先进性能。模型在UNBC-McMaster数据集上训练,人脸经3D配准并旋转至标准正面视角。实验中我们确定了超参数空间的重要区域及其与视觉和视频视觉 transformers 的交互,获得3个值得注意的模型。我们分析其中一个模型的注意力图,为其预测找到合理阐释。我们还评估了Mixup这一增强技术与Sharpness-Aware Minimization这一优化器,但未获成功。我们提出的模型ViT-1(F1分数 0.55 +- 0.15)、ViViT-1(F1分数 0.55 +- 0.13)和ViViT-2(F1分数 0.49 +- 0.04)均优于先前工作,展示了视觉 transformers 用于疼痛检测的潜力。代码见 https://github.com/IPDTFE/ViT-McMaster

关键词

引用

@article{arxiv.2210.15769,
  title  = {Fully-attentive and interpretable: vision and video vision transformers for pain detection},
  author = {Giacomo Fiorentini and Itir Onal Ertugrul and Albert Ali Salah},
  journal= {arXiv preprint arXiv:2210.15769},
  year   = {2022}
}

备注

9 pages (12 with references), 10 figures, VTTA2022