一种用于稳定人脸对齐的可替换骨干网络微调框架
计算机视觉与模式识别
2020-11-16 v2
摘要
基于热图回归的人脸对齐在静态图像上已取得优异性能。然而,将现有方法应用于动态视频时,稳定性与准确性显著下降。我们将此退化归因于视频中常见的随机噪声与运动模糊。时间信息对解决该问题至关重要,却在现有工作中未被充分考虑。本文从两个角度审视面向视频的人脸对齐问题:检测精度要求单帧误差更低,而检测一致性要求相邻帧间更好的稳定性。在此基础上,我们提出一种抖动损失函数,利用时间信息抑制不准确及抖动的 landmarks。该抖动损失被纳入一种新颖框架,其在可替换骨干网络上以微调 ConvLSTM 结构实现。我们进一步证明,准确且稳定的 landmarks 在标准坐标下与具有重叠的不同区域相关联,基于此所提抖动损失促进了训练中的优化过程。所提框架在稳定性评价指标上取得至少 40% 的提升,同时较 SOTA 方法提高了检测精度。一般而言,它无需重训整个模型,即可将人脸图像 landmark 检测器快速转换为性能更优的视频检测器。
引用
@article{arxiv.2010.09501,
title = {A Backbone Replaceable Fine-tuning Framework for Stable Face Alignment},
author = {Xu Sun and Zhenfeng Fan and Zihao Zhang and Yingjie Guo and Shihong Xia},
journal= {arXiv preprint arXiv:2010.09501},
year = {2020}
}
备注
10 pages, 8 figures