中文

用于人体姿态估计与图像识别的二值网络改进训练

计算机视觉与模式识别 2019-04-12 v1

摘要

在大型数据集上训练的大型神经网络在多种具有挑战性的问题上推进了 SOTA,大幅提升了性能。然而,在低内存和有限计算能力的约束下,相同问题上的准确率会显著下降。在本文中,我们提出了一系列技术,显著提高了二值化神经网络的准确率(即特征和权重均为二值的网络)。我们在两个不同的任务上评估了所提出的改进:细粒度识别(人体姿态估计)和大规模图像识别(ImageNet 分类)。具体而言,我们引入了一系列新颖的方法学改进,包括:更合适的激活函数、逆序初始化、渐进量化和网络堆叠,并表明这些添加显著改进了现有的 SOTA 网络二值化技术。此外,我们首次研究了网络二值化与知识蒸馏可以在多大程度上结合。在具有挑战性的 MPII 数据集上进行测试时,我们的方法在绝对值上显示出超过 4% 的性能提升。最后,我们通过将所提出的技术应用于 ImageNet 数据集上的大规模物体识别,进一步验证了我们的发现,在该数据集上我们报告了 4% 的错误率降低。

关键词

引用

@article{arxiv.1904.05868,
  title  = {Improved training of binary networks for human pose estimation and image recognition},
  author = {Adrian Bulat and Georgios Tzimiropoulos and Jean Kossaifi and Maja Pantic},
  journal= {arXiv preprint arXiv:1904.05868},
  year   = {2019}
}