一种用于带噪声标签深度人脸表示的轻量CNN
计算机视觉与模式识别
2018-08-14 v4
摘要
为更好地拟合大量训练数据,为人脸识别提出的卷积神经网络(CNN)模型规模持续增大。当训练数据从互联网获取时,标签可能存在歧义且不精确。本文提出一种Light CNN框架,用于在带有海量噪声标签的大规模人脸数据上学习紧凑的嵌入。首先,我们将一种称为Max-Feature-Map(MFM)的maxout激活变体引入CNN的每一个卷积层。与利用许多特征图线性近似任意凸激活函数的maxout激活不同,MFM通过竞争关系实现这一点。MFM不仅能分离噪声与信息性信号,还能在两个特征图之间起到特征选择的作用。其次,精心设计了三个网络,以在获得更好性能的同时减少参数数量和计算成本。最后,提出一种语义自助法(semantic bootstrapping)方法,使网络的预测与噪声标签更一致。实验结果表明,所提框架能利用大规模噪声数据学习一个在计算成本和存储空间上高效的轻量模型。学习到的具有256维表示的单一网络在各种人脸基准上无需微调即达到了最先进结果。代码发布于 https://github.com/AlfredXiangWu/LightCNN。
引用
@article{arxiv.1511.02683,
title = {A Light CNN for Deep Face Representation with Noisy Labels},
author = {Xiang Wu and Ran He and Zhenan Sun and Tieniu Tan},
journal= {arXiv preprint arXiv:1511.02683},
year = {2018}
}
备注
arXiv admin note: text overlap with arXiv:1507.04844. The models are released on https://github.com/AlfredXiangWu/LightCNN, IEEE Transactions on Information Forensics and Security, 2018