中文

知止而退:基于块注意力选择性级联回归的实时人脸对齐

计算机视觉与模式识别 2021-08-04 v2

摘要

人脸关键点(FLM)估计是许多人脸相关应用中的关键组件。在这项工作中,我们旨在优化准确率和速度,并探索它们之间的权衡。我们的关键观察是,并非所有人脸都是平等的。具有中性表情的正面人脸比具有极端姿态或表情的人脸收敛更快。为了区分样本,我们训练模型在每次迭代后预测回归误差。如果当前迭代足够准确,我们停止迭代,节省冗余迭代同时保持准确率受控。我们还观察到,随着相邻块重叠,我们可以仅用少量块推断所有人脸关键点(FLM)而不牺牲主要准确率。在架构上,我们提供了一种多尺度、基于块、轻量的特征提取器,带有细粒度局部块注意力模块,该模块根据块自身的信息计算块权重并增强块特征的表达能力。我们分析块注意力数据以推断模型在回归人脸关键点时关注的位置,并将其与人类的面部注意力进行比较。我们的模型在移动设备 GPU 上实时运行,具有 95 兆乘加(MMA)操作,在以 1000 MMA 以下的所有最先进方法中表现最优,在 300W 挑战性数据集上归一化平均误差为 8.16。

关键词

引用

@article{arxiv.2108.00377,
  title  = {Knowing When to Quit: Selective Cascaded Regression with Patch Attention for Real-Time Face Alignment},
  author = {Gil Shapira and Noga Levy and Ishay Goldin and Roy J. Jevnisek},
  journal= {arXiv preprint arXiv:2108.00377},
  year   = {2021}
}

备注

Accepted to the 29th ACM International Conference on Multimedia (MM 21)