中文

前视声纳图像块匹配:现代 CNN、集成学习与不确定性

计算机视觉与模式识别 2021-08-03 v1 机器人学

摘要

水下机器人的应用日益增多,其中大多数依赖声纳进行水下视觉感知,但感知能力的不足限制了它们在此任务中的表现。声纳感知中的一个重要问题是图像块匹配,它能够支撑定位、变化检测和建图等其他技术。在彩色图像领域,该问题已有丰富的文献,但在声学图像中,由于生成这些图像的物理原理,相关研究较为匮乏。本文改进了我们之前针对此问题的成果(Valdenegro-Toro 等, 2017),不再手动设计特征,而是由卷积神经网络(CNN)学习一个相似度函数,并预测两幅输入声纳图像是否相似。为进一步改善声纳图像匹配问题,我们在 Marine Debris 数据集上评估了三种最先进的 CNN 架构,即 DenseNet 和 VGG,采用孪生或双通道架构,并使用对比损失。为确保对每个网络进行公平评估,我们执行了全面的超参数优化。我们发现,表现最佳的模型是双通道 DenseNet 网络(AUC 0.955)、采用对比损失的 VGG-孪生网络(AUC 0.949)以及 DenseNet-孪生网络(AUC 0.921)。通过集成表现最好的双通道 DenseNet 和 DenseNet-孪生模型,获得的最高总体预测准确率达到 0.978 AUC,相较于现有最佳水平的 0.91 AUC 有显著提升。

关键词

引用

@article{arxiv.2108.01066,
  title  = {Forward-Looking Sonar Patch Matching: Modern CNNs, Ensembling, and Uncertainty},
  author = {Arka Mallick and Paul Plöger and Matias Valdenegro-Toro},
  journal= {arXiv preprint arXiv:2108.01066},
  year   = {2021}
}

备注

Global Oceans 2021 Camera ready, 7 pages, 8 figures