用于学习深度人脸表示的尺度注意力:一项针对视觉尺度变化的研究
计算机视觉与模式识别
2022-09-20 v1
摘要
人脸图像通常以大范围视觉尺度出现。现有人脸表示通过多尺度方案追求处理尺度变化的带宽,该方案组装有限系列预定义尺度。这种多 shot 方案带来推理负担,且预定义尺度与真实数据难免存在差距。相反,从数据学习尺度参数并用于单次特征推理是一种妥当方案。为此,我们借助尺度空间理论改造卷积层,获得两方面便利:1)卷积层从真实数据分布学习一组尺度,每个尺度由一个卷积核实现;2)该层自动在对应输入模式尺度及其出现的恰当通道和位置处高亮特征。随后,我们通过堆叠改造层完成层次化尺度注意力,构建名为尺度注意力卷积神经网络(\textbf{SCAN-CNN})的新结构。我们将 SCAN-CNN 应用于人脸识别任务,推动了 SOTA 性能的前沿。在人脸图像模糊时准确率提升更为明显。同时,作为单 shot 方案,其推理比多 shot 融合更高效。我们提供一组工具以确保 SCAN-CNN 的快速训练,且与普通 CNN 相比推理成本零增加。
引用
@article{arxiv.2209.08788,
title = {Scale Attention for Learning Deep Face Representation: A Study Against Visual Scale Variation},
author = {Hailin Shi and Hang Du and Yibo Hu and Jun Wang and Dan Zeng and Ting Yao},
journal= {arXiv preprint arXiv:2209.08788},
year = {2022}
}