中文

用于动作单元检测的视觉 Transformer

计算机视觉与模式识别 2023-03-21 v2

摘要

面部动作单元检测(FAUs)是一个细粒度分类问题,涉及识别人脸上的不同单元,如面部动作编码系统所定义。在本文中,我们提出了一种简单而高效的基于 Vision Transformer 的方法,用于解决自然场景下情感行为分析(ABAW)竞赛中的动作单元(AU)检测任务。我们采用 Video Vision Transformer (ViViT) 网络来捕获视频中的面部时间变化。此外,为减小 Vision Transformers 模型的庞大尺寸,我们将 ViViT 的特征提取层替换为 CNN 主干网络(Regnet)。我们的模型优于 ABAW 2023 挑战赛的基线模型,结果差异显著达 14%。此外,所取得的成绩可与先前 ABAW 2022 挑战赛前三名团队的结果相媲美。

关键词

引用

@article{arxiv.2303.09917,
  title  = {Vision Transformer for Action Units Detection},
  author = {Tu Vu and Van Thong Huynh and Soo Hyung Kim},
  journal= {arXiv preprint arXiv:2303.09917},
  year   = {2023}
}

备注

Will be updated