基于中间概念的深度监督
计算机视觉与模式识别
2018-07-23 v2
摘要
近期数据驱动的场景解释方法主要将推断视为端到端的黑盒映射,通常由卷积神经网络(CNN)执行。然而,数十年来关于人类与机器视觉中感知组织的研究表明,常常存在对推断任务而言固有的中间表示,并为改进泛化提供基本结构。在本工作中,我们探索了一种通过将 CNN 的隐藏层用实践中通常不可观测的中间概念进行监督,从而将先验领域结构注入神经网络训练的方法。我们形式化了一个概率框架,其规范了这些概念,并经由该深度监督方法预测了改进的泛化。该方法的一个优势是我们仅能从带杂波场景的合成 CAD 渲染图训练(其中可提取概念值),但将结果应用于真实图像。我们的实现在真实图像基准(包括 KITTI、PASCAL VOC、PASCAL3D+、IKEA 和 CIFAR100)上取得了 2D/3D 关键点定位与图像分类的当前最优性能。我们提供了额外证据,表明我们的方法优于多任务网络等替代监督形式。
引用
@article{arxiv.1801.03399,
title = {Deep Supervision with Intermediate Concepts},
author = {Chi Li and M. Zeeshan Zia and Quoc-Huy Tran and Xiang Yu and Gregory D. Hager and Manmohan Chandraker},
journal= {arXiv preprint arXiv:1801.03399},
year = {2018}
}
备注
Submitted to TPAMI, first revision. arXiv admin note: text overlap with arXiv:1612.02699