中文

用于视频人脸识别的特征聚合网络

计算机视觉与模式识别 2019-09-13 v2 人工智能

摘要

本文旨在为视频人脸识别任务学习视频的紧凑表示。我们的贡献如下:首先,提出一种基于元注意力的聚合方案,该方案沿所有帧的每一特征维度自适应且细粒度地加权特征,以形成紧凑且具判别力的表示。它最大限度地利用了每帧中有价值或具判别力的部分来提升人脸识别性能,而不像通常方法那样丢弃或轻视低质量帧。其次,我们构建了一个由特征嵌入模块与特征聚合模块组成的特征聚合网络。嵌入模块是用于从人脸图像提取特征向量的卷积神经网络,而聚合模块由级联的两个元注意力块构成,自适应地将特征向量聚为单一固定长度表示。该网络可处理任意数量帧,且对帧顺序不敏感。第三,我们验证了所提聚合方案的性能。在 YouTube face 数据集与 IJB-A 数据集等公开可用数据集上的实验显示了方法的有效性,并在验证与识别协议下均取得具竞争力的性能。

关键词

引用

@article{arxiv.1905.01796,
  title  = {Feature Aggregation Network for Video Face Recognition},
  author = {Zhaoxiang Liu and Huan Hu and Jinqiang Bai and Shaohua Li and Shiguo Lian},
  journal= {arXiv preprint arXiv:1905.01796},
  year   = {2019}
}

备注

9 pages, 4 figures, Accepted by ICCV 2019 workshop