PAD-Net:用于深度估计与场景解析联合预测与蒸馏的多任务引导网络
计算机视觉与模式识别
2018-05-14 v1
摘要
深度估计与场景解析是视觉场景理解中两项尤为重要的任务。本文研究在联合CNN中同时实现深度估计与场景解析的问题。该任务通常可视为深度多任务学习问题[42]。与以往方法直接利用输入训练数据优化多个任务不同,本文提出一种新颖的多任务引导预测与蒸馏网络(PAD-Net),其首先预测一组从低层到高层的中间辅助任务,然后通过我们提出的多模态蒸馏模块将这些中间辅助任务的预测结果作为多模态输入用于最终任务。在联合学习过程中,中间任务不仅作为监督信号以学习更具鲁棒性的深度表征,还为最终任务提供丰富的多模态信息。我们在两个具有挑战性的数据集(即NYUD-v2和Cityscapes)上针对深度估计与场景解析任务进行了大量实验,证明了所提方法的有效性。
引用
@article{arxiv.1805.04409,
title = {PAD-Net: Multi-Tasks Guided Prediction-and-Distillation Network for Simultaneous Depth Estimation and Scene Parsing},
author = {Dan Xu and Wanli Ouyang and Xiaogang Wang and Nicu Sebe},
journal= {arXiv preprint arXiv:1805.04409},
year = {2018}
}
备注
Accepted at CVPR 2018