基于注意力集合的度量学习用于视频人脸识别
计算机视觉与模式识别
2017-08-29 v3
摘要
随着深度学习的发展,人脸识别取得了巨大进展。然而,由于各种光照、低分辨率、姿态变化和运动模糊,视频人脸识别(VFR)仍是一项进行中的任务。大多数现有的基于CNN的VFR方法仅从单幅图像获取特征向量并简单聚合视频中的特征,较少考虑同一视频中人脸图像的相关性。本文提出一种新颖的基于注意力集合的度量学习(ASML)方法来度量图像集合的统计特征。它是最大均值差异带有记忆注意力加权的有前景的广义扩展。首先,我们定义图像集合上的有效距离度量,显式地同时最小化集合内距离和最大化集合间距离。其次,受神经图灵机启发,提出记忆注意力加权(Memory Attention Weighting)以适应集合感知的全局内容。然后将ASML自然集成到CNN中,形成端到端学习方案。我们的方法在三个广泛使用的基准包括YouTubeFace、YouTube Celebrities和Celebrity-1000上的视频人脸识别任务中取得了最先进的性能。
引用
@article{arxiv.1704.03805,
title = {Attention-Set based Metric Learning for Video Face Recognition},
author = {Yibo Hu and Xiang Wu and Ran He},
journal= {arXiv preprint arXiv:1704.03805},
year = {2017}
}
备注
modify for ACPR