原型Transformer:基于原型的统一面部关键点检测
计算机视觉与模式识别
2025-10-20 v1
摘要
近期深度学习技术显著提升了面部关键点检测性能。然而,现有面部关键点检测数据集通常定义不同数量的关键点,大多数主流方法只能在单个数据集上进行训练。这限制了模型对不同数据集的泛化能力,并阻碍了统一模型的开发。为此,我们提出Proto-Former,一个统一、自适应、端到端的面部关键点检测框架,显式地增强数据集特定的面部结构表示(即原型)。Proto-Former 通过在统一架构中实现跨多个数据集的联合训练,克服了单数据集训练的局限性。具体而言,Proto-Former 包含两个关键组件:执行自适应特征提取并学习原型表示的自适应原型感知编码器(Adaptive Prototype-Aware Encoder, APAE),以及细化这些原型以生成引导模型注意力聚焦于关键面部区域的渐进式原型感知解码器(Progressive Prototype-Aware Decoder, PPAD)。此外,我们引入了一种新的原型感知(Prototype-Aware, PA)损失,通过约束原型专家的选择权重来实现最优路径寻找。该损失函数有效解决了多数据集训练中原型专家寻址不稳定问题,减轻了梯度冲突,使能够提取更准确的面部结构特征。广泛的在常用基准数据集上的实验表明,Proto-Former 在性能上优于现有领先方法。代码已公开于 https://github.com/Husk021118/Proto-Former。
引用
@article{arxiv.2510.15338,
title = {Proto-Former: Unified Facial Landmark Detection by Prototype Transformer},
author = {Shengkai Hu and Haozhe Qi and Jun Wan and Jiaxing Huang and Lefei Zhang and Hang Sun and Dacheng Tao},
journal= {arXiv preprint arXiv:2510.15338},
year = {2025}
}
备注
This paper has been accepted by TMM October 2025. Project page:https://github.com/Husk021118/Proto-Former