中文

通过估计输入图像边界框分布训练多目标检测器

计算机视觉与模式识别 2021-09-07 v4

摘要

在使用神经网络的多目标检测中,根本问题是“网络应如何学习不同输入图像中可变数量的边界框?”。先前方法通过将真值边界框直接分配给网络输出的特定位置来训练多目标检测网络。然而,该过程使多目标检测网络的训练过于启发式且复杂。本文中,我们将多目标检测任务重新表述为边界框密度估计问题。我们不再将每个真值分配给网络输出的特定位置,而是通过使用混合模型估计输入图像中边界框的概率密度来训练网络。为此,我们提出一种用于目标检测的新网络,称为混合密度目标检测器(Mixture Density Object Detector, MDOD),以及用于基于密度估计训练的目标函数。我们将 MDOD 应用于 MS COCO 数据集。我们所提方法不仅以新途径处理多目标检测问题,还通过 MDOD 提升了检测性能。代码可用:https://github.com/yoojy31/MDOD。

关键词

引用

@article{arxiv.1911.12721,
  title  = {Training Multi-Object Detector by Estimating Bounding Box Distribution for Input Image},
  author = {Jaeyoung Yoo and Hojun Lee and Inseop Chung and Geonseok Seo and Nojun Kwak},
  journal= {arXiv preprint arXiv:1911.12721},
  year   = {2021}
}

备注

10 pages, 7 figures