基于立体视频稀疏编码的目标检测
计算机视觉与模式识别
2017-12-04 v2
摘要
深度卷积神经网络(DCNN)在图像分类和目标检测任务中需要数百万标注训练样本,这限制了这些模型只能应用于存在此类数据集的领域。本文探索将无监督稀疏编码应用于立体视频数据,以帮助缓解对大量标注数据的需求。我们证明,在DCNN中用无监督稀疏编码层替代典型的监督卷积层,可在仅有有限标注训练样本的情况下,在车辆检测任务上取得更优性能。此外,与全监督DCNN相比,结合稀疏编码的网络在不同初始化和训练样本顺序下表现出更一致的性能。最后,我们比较了无监督稀疏编码层和监督卷积层的激活情况,发现稀疏表示展现出深度选择性的编码,而卷积层的编码则未表现出这种选择性。这些结果表明,在标注训练数据有限的领域中,将无监督稀疏编码方法应用于现实世界计算机视觉任务具有前景。
引用
@article{arxiv.1705.07144,
title = {Sparse Coding on Stereo Video for Object Detection},
author = {Sheng Y. Lundquist and Melanie Mitchell and Garrett T. Kenyon},
journal= {arXiv preprint arXiv:1705.07144},
year = {2017}
}