当李比希木桶遇见人脸关键点检测:一个实用模型
计算机视觉与模式识别
2021-06-03 v2
摘要
近年来,人脸关键点检测研究取得了显著进展。然而,鲜有先前工作深入讨论面向实际应用的模型,而是往往一次仅关注改进少数问题而忽略其余。为弥补这一差距,我们旨在探索一个同时具备准确、鲁棒、高效、可泛化且端到端可训练特性的实用模型。为此,我们首先提出一个以单个 transformer 解码器作为检测头的基线模型。为获得更好精度,我们进一步提出两个轻量模块,即动态查询初始化(DQInit)与查询感知记忆(QAMem)。具体而言,DQInit 从输入动态初始化解码器查询,使模型达到与使用多层解码器相当的精度。QAMem 旨在通过对每个查询分配独立记忆值而非共享值,增强查询在低分辨率特征图上的判别能力。借助 QAMem,我们的模型摆脱了对高分辨率特征图的依赖,仍可获得优越精度。在三个流行基准上的大量实验与分析显示了所提模型的有效性与实用优势。值得注意的是,我们的模型在 WFLW 上取得新的 SOTA,在 300W 与 COFW 上取得具竞争力的结果,同时仍以 50+ FPS 运行。
引用
@article{arxiv.2105.13150,
title = {When Liebig's Barrel Meets Facial Landmark Detection: A Practical Model},
author = {Haibo Jin and Jinpeng Li and Shengcai Liao and Ling Shao},
journal= {arXiv preprint arXiv:2105.13150},
year = {2021}
}
备注
Fix minor errors