基于动态语义聚合变换器的精确面部关键点检测
计算机视觉与模式识别
2024-12-03 v1
摘要
当前深度神经网络方法在面部对齐领域占据主导地位,但它们通常使用预定义的网络结构来预测关键点,倾向于学习通用特征,导致表现平庸。例如,它们在中性样本上表现良好,但在大姿态或遮挡的面部上却难以应对。此外,它们无法有效处理不同尺度特征之间语义差距和歧义,这可能阻碍其高效特征学习。为解决上述问题,本文提出了一种用于更具辨识度和代表性特征(即专业化特征)学习的动态语义聚合变换器(DSAT)。具体而言,首先提出了一种动态语义感知(DSA)模型,用于将样本划分为子集,并通过估计特征通道的语义相关性来激活它们,从而实现从每个子集中学习专业化特征。然后,设计了一种新颖的动态语义专业化(DSS)模型,用于从不同尺度的特征中挖掘均匀信息,以消除语义差距和歧义并增强表示能力。最后,通过将DSA模型和DSS模型以动态架构和动态参数方式集成到我们提出的DSAT中,可以学习更专业化的特征,以实现更精确的面部对齐。有趣的是,更难的样本可以通过激活更多特征通道来处理。在流行的面部对齐数据集上进行的广泛实验表明,我们提出的DSAT在文献中超越了最先进的模型。我们的代码可在 https://github.com/GERMINO-LiuHe/DSAT 上获得。
引用
@article{arxiv.2412.00740,
title = {Precise Facial Landmark Detection by Dynamic Semantic Aggregation Transformer},
author = {Jun Wan and He Liu and Yujia Wu and Zhihui Lai and Wenwen Min and Jun Liu},
journal= {arXiv preprint arXiv:2412.00740},
year = {2024}
}