重新思考用于计算机视觉的 Inception 架构
计算机视觉与模式识别
2015-12-14 v3
摘要
卷积网络是绝大多数最先进(state-of-the-art)计算机视觉解决方案的核心,应用于广泛任务。自 2014 年以来,非常深的卷积网络开始成为主流,在各种基准上取得显著提升。尽管对于大多数任务,增大的模型规模与计算成本往往能直接转化为质量提升(只要提供足够标注数据训练),但计算效率与低参数量仍是移动视觉与大数据等应用场景的赋能因素。本文探索以尽可能高效利用新增计算的方式来扩展网络,采用合适的分解卷积与强正则化。我们在 ILSVRC 2012 分类挑战验证集上评测方法,展示出相对于 state-of-the-art 的显著提升:使用单次推理计算量为 50 亿次乘加、参数少于 2500 万的网络,单帧评估的 top-1 误差为 21.2%、top-5 误差为 5.6%。通过 4 个模型集成与多裁剪评估,我们报告验证集上 top-5 误差 3.5%(测试集 3.6%)以及验证集上 top-1 误差 17.3%。
引用
@article{arxiv.1512.00567,
title = {Rethinking the Inception Architecture for Computer Vision},
author = {Christian Szegedy and Vincent Vanhoucke and Sergey Ioffe and Jonathon Shlens and Zbigniew Wojna},
journal= {arXiv preprint arXiv:1512.00567},
year = {2015}
}