LOTR:基于定位 Transformer 的人脸关键点定位
计算机视觉与模式识别
2022-10-06 v3 人工智能
机器学习
摘要
本文提出一种新颖的基于 Transformer 的人脸关键点定位网络,名为定位 Transformer(Localization Transformer, LOTR)。所提框架是一种直接坐标回归方法,利用 Transformer 网络更好地利用特征图中的空间信息。LOTR 模型由三个主要模块组成:1)将输入图像转换为特征图的视觉骨干网络;2)改善来自视觉骨干网络的特征表示的 Transformer 模块;3)从 Transformer 的表示中直接预测关键点坐标的关键点预测头。给定裁剪对齐的人脸图像,所提 LOTR 可端到端训练,无需任何后处理步骤。本文还引入了 smooth-Wing 损失函数,其解决了 Wing 损失的梯度不连续问题,比 L1、L2 和 Wing 等标准损失函数具有更好的收敛性。在首届 106 点人脸关键点定位大赛提供的 JD 关键点数据集上的实验结果表明,LOTR 优于排行榜上的现有方法及两种近期基于热力图的方法。在 WFLW 数据集上,所提 LOTR 框架相较若干最先进方法展现出有前景的结果。此外,我们报告了使用所提 LOTR 进行人脸对齐时最先进人脸识别性能的提升。
引用
@article{arxiv.2109.10057,
title = {LOTR: Face Landmark Localization Using Localization Transformer},
author = {Ukrit Watchareeruetai and Benjaphan Sommana and Sanjana Jain and Pavit Noinongyao and Ankush Ganguly and Aubin Samacoits and Samuel W. F. Earp and Nakarin Sritrakool},
journal= {arXiv preprint arXiv:2109.10057},
year = {2022}
}
备注
Accepted for publication in IEEE Access