中文

深度目标检测的协同训练:单模态与多模态方法的比较

计算机视觉与模式识别 2021-05-05 v1 机器学习

摘要

性能最佳的计算机视觉模型由卷积神经网络(CNNs)驱动。训练准确的 CNN 高度依赖于原始传感器数据及其相关真值(GT)。收集此类 GT 通常通过人工标注完成,这耗时且无法按我们期望的规模扩展。这种数据标注瓶颈可能因图像传感器间的域偏移而加剧,这可能迫使逐传感器数据标注。在本文中,我们聚焦于使用协同训练这一半监督学习(SSL)方法来获取自标注的目标边界框(BBs),即用于训练深度目标检测器的 GT。特别地,我们通过依赖图像的两个不同视图(即外观(RGB)和估计深度(D))来评估多模态协同训练的有效性。此外,我们将基于外观的单模态协同训练与多模态进行比较。我们的结果表明,在标准 SSL 设定(无域偏移,少量人工标注数据)和虚拟到真实域偏移下(大量虚拟世界标注数据,无人工标注数据),多模态协同训练优于单模态。在后一种情况下,通过执行基于 GAN 的域翻译,两种协同训练模态表现相当;至少,当使用未在翻译图像上专门训练的现成深度估计模型时如此。

关键词

引用

@article{arxiv.2104.11619,
  title  = {Co-training for Deep Object Detection: Comparing Single-modal and Multi-modal Approaches},
  author = {Jose L. Gómez and Gabriel Villalonga and Antonio M. López},
  journal= {arXiv preprint arXiv:2104.11619},
  year   = {2021}
}