利用嫁接网络学习利用多种视觉模态
计算机视觉与模式识别
2020-07-23 v3 机器学习
摘要
热成像、高光谱、偏振和事件相机等新型视觉传感器提供了常规强度相机所不具备的信息。将这些传感器与当前强大的深度神经网络结合使用的障碍在于缺乏大规模标注训练数据集。本文提出一种网络嫁接算法(NGA),其中由非传统视觉输入驱动的新前端网络替换了处理强度帧的预训练深度网络的前端网络。自监督训练仅使用同步记录的强度帧和新型传感器数据,以最大化预训练网络与嫁接网络之间的特征相似性。我们表明,在热成像和事件相机数据集上的目标检测任务中,增强的嫁接网络达到了与预训练网络相当的 average precision (AP50) 分数,且推理成本未增加。特别地,由热成像帧驱动的嫁接网络相比使用强度帧取得了 49.11% 的相对提升。嫁接前端仅占总参数的 5--8%,并且可在单块 GPU 上以相当于从标注数据训练整个目标检测器所需时间的 5% 的几小时内完成训练。NGA 使新型视觉传感器能够利用先前预训练的强大的深度模型,节省训练成本并拓宽新型传感器的应用范围。
引用
@article{arxiv.2003.10959,
title = {Learning to Exploit Multiple Vision Modalities by Using Grafted Networks},
author = {Yuhuang Hu and Tobi Delbruck and Shih-Chii Liu},
journal= {arXiv preprint arXiv:2003.10959},
year = {2020}
}
备注
Accepted at ECCV 2020, 14 pages