用于视频全面场景理解的蒸馏语义
计算机视觉与模式识别
2020-04-01 v1 机器学习
摘要
对周围环境的全面理解对自主系统至关重要。近期的工作表明,深度神经网络可以在没有任何来自真实标注的显式监督下从单目视频中学习几何(深度)和运动(光流),而这些真实标注对于这两个任务而言尤其难以获取。在本文中,我们通过将深度和运动与语义共同学习,向基于单目相机的整体场景理解迈出了新的一步,其中语义的监督由一个预训练网络蒸馏出的代理真实图像提供。我们通过 a) 一种基于知识蒸馏和自监督的全新训练方案,以及 b) 一种紧凑的网络架构,联合处理这三项任务,该架构使得在耗电的 GPU 和低功耗嵌入式平台上均能实现高效的场景理解。我们全面评估了我们的框架性能,并表明它在单目深度估计、光流和运动分割上取得了 SOTA 的结果。
引用
@article{arxiv.2003.14030,
title = {Distilled Semantics for Comprehensive Scene Understanding from Videos},
author = {Fabio Tosi and Filippo Aleotti and Pierluigi Zama Ramirez and Matteo Poggi and Samuele Salti and Luigi Di Stefano and Stefano Mattoccia},
journal= {arXiv preprint arXiv:2003.14030},
year = {2020}
}
备注
CVPR 2020. Code will be available at https://github.com/CVLAB-Unibo/omeganet