基于级联 Transformer 的精确人脸关键点检测
计算机视觉与模式识别
2022-08-24 v1
摘要
精确的人脸关键点是以人脸为对象的诸多任务的重要前提。本文提出一种基于级联 Transformer 的精确人脸关键点检测器。我们将人脸关键点检测建模为坐标回归任务,从而使模型能够端到端训练。借助 Transformer 中的自注意力机制,我们的模型能够内在地利用关键点之间的结构化关系,这将有利于在大姿态和遮挡等挑战性条件下的关键点检测。在级联精化过程中,基于可变形注意力机制,我们的模型能够提取目标关键点周围最相关的图像特征用于坐标预测,从而带来更精确的对齐。此外,我们提出一种新颖的解码器,可同时精化图像特征与关键点位置。在参数增加极少的情况下,检测性能得到进一步提升。我们的模型在多个标准人脸关键点检测基准上取得了新的 SOTA 性能,并在跨数据集评估中展现出良好的泛化能力。
引用
@article{arxiv.2208.10808,
title = {Towards Accurate Facial Landmark Detection via Cascaded Transformers},
author = {Hui Li and Zidong Guo and Seon-Min Rhee and Seungju Han and Jae-Joon Han},
journal= {arXiv preprint arXiv:2208.10808},
year = {2022}
}