中文

FGTBT:用于统一人脸关键点检测的频率引导任务平衡 Transformer

计算机视觉与模式识别 2026-01-21 v1

摘要

近年来,基于深度学习的人脸关键点检测(FLD)方法取得了相当大的成功。然而,在大姿态变化、光照变化和面部表情变化等具有挑战性的场景中,它们仍然难以准确捕捉面部的几何结构,导致性能下降。此外,现有 FLD 数据集的规模和多样性有限,阻碍了鲁棒的模型训练,导致检测精度降低。为了应对这些挑战,我们提出了一种频率引导任务平衡 Transformer(FGTBT),它通过频域建模和多数据集统一训练来增强面部结构感知。具体而言,我们提出了一种新颖的细粒度多任务平衡损失(FMB-loss),它通过根据各个关键点在数据集中的出现情况为其分配权重,超越了粗略的任务级平衡。这使得统一训练更加有效,并缓解了梯度幅度不一致的问题。此外,设计了一个频率引导结构感知(FGSA)模型,利用频率引导的结构注入和正则化来帮助学习面部结构约束。在流行基准数据集上的大量实验结果表明,将所提出的 FMB-loss 和 FGSA 模型集成到我们的 FGTBT 框架中,取得了与 state-of-the-art 方法相当的性能。代码可在 https://github.com/Xi0ngxinyu/FGTBT 获取。

关键词

引用

@article{arxiv.2601.12863,
  title  = {FGTBT: Frequency-Guided Task-Balancing Transformer for Unified Facial Landmark Detection},
  author = {Jun Wan and Xinyu Xiong and Ning Chen and Zhihui Lai and Jie Zhou and Wenwen Min},
  journal= {arXiv preprint arXiv:2601.12863},
  year   = {2026}
}