中文

面向多模态目标检测的不确定性知情数据选择

计算机视觉与模式识别 2023-04-25 v1 图像与视频处理

摘要

噪声通过在模型推理中造成混淆从而降低数据的信息量,一直是目标检测中不可忽略的困扰。它可因观测模式的偏移导致识别不准确,这就要求模型具备鲁棒泛化能力。为实现通用视觉模型,我们需要开发能够从多模态数据中自适应选择有效信息的深度学习模型。这主要基于两点原因:多模态学习可突破单模态数据固有缺陷,而自适应信息选择可减少多模态数据中的混乱。为解决该问题,我们提出一种通用的不确定性感知多模态融合模型。其采用多流水线松耦合架构来结合点云与图像的特征及结果。为量化多模态信息中的相关性,我们将不确定性建模为数据信息的倒数,跨不同模态并嵌入边界框生成中。由此,我们的模型降低了融合中的随机性并生成可靠输出。此外,我们在KITTI 2D目标检测数据集及其衍生的脏数据上进行了完整调研。我们的融合模型被证明能抵抗高斯、运动模糊和霜冻等严重噪声干扰,仅出现轻微退化。实验结果展示了自适应融合的益处。我们对多模态融合鲁棒性的分析将为未来研究提供进一步见解。

关键词

引用

@article{arxiv.2304.11697,
  title  = {Informative Data Selection with Uncertainty for Multi-modal Object Detection},
  author = {Xinyu Zhang and Zhiwei Li and Zhenhong Zou and Xin Gao and Yijin Xiong and Dafeng Jin and Jun Li and Huaping Liu},
  journal= {arXiv preprint arXiv:2304.11697},
  year   = {2023}
}