1DFormer:一种学习用于人脸关键点跟踪的一维关键点表示的Transformer架构
计算机视觉与模式识别
2024-02-02 v2
摘要
近来,基于一维关键点表示的热图回归方法在定位人脸关键点方面展现出卓越性能。然而,先前方法忽视了对一维关键点表示在多个关键点的时序与结构建模以跟踪人脸关键点方面的良好潜力进行深度挖掘。为克服此局限,我们提出一种Transformer架构,即1DFormer,其通过在时间与空间维度上的令牌通信捕获关键点的动态与几何模式,学习信息丰富的一维关键点表示,用于人脸关键点跟踪。对于时序建模,我们提出循环令牌混合机制、轴-关键点-位置嵌入机制以及置信度增强的多头注意力机制,以自适应且鲁棒地将长期关键点动态嵌入其一维表示;对于结构建模,我们设计组内与组间结构建模机制,通过一维卷积层在空间维度上的令牌通信,将部件级与全局级人脸结构模式编码为关键点一维表示的精炼。在300VW与TF数据库上的实验结果表明,1DFormer成功建模长程时序模式与内在人脸结构,学习到信息丰富的关键点序列一维表示,并在人脸关键点跟踪上取得最先进(SOTA)性能。
引用
@article{arxiv.2311.00241,
title = {1DFormer: a Transformer Architecture Learning 1D Landmark Representations for Facial Landmark Tracking},
author = {Shi Yin and Shijie Huan and Shangfei Wang and Jinshui Hu and Tao Guo and Bing Yin and Baocai Yin and Cong Liu},
journal= {arXiv preprint arXiv:2311.00241},
year = {2024}
}