研究海底视觉影像的位置正则化自监督特征学习
计算机视觉与模式识别
2025-09-09 v1 机器人学
摘要
对机器人采集的海底视觉影像进行高通量解释可以提高海洋监测和探索的效率。尽管最近的研究表明位置元数据可以增强自监督特征学习(SSL),但其在不同 SSL 策略、模型和海底图像数据集上的益处尚未得到充分探索。本研究评估了基于位置的正则化对六个 SOTA SSL 框架的影响,这些框架包括具有不同隐空间维度的卷积神经网络(CNN)和 Vision Transformer(ViT)模型。在三个不同的海底图像数据集上的评估发现,与标准 SSL 相比,位置正则化持续提高了下游分类性能,CNN 和 ViT 的平均 F1 分数分别提升了 和 。虽然在通用数据集上预训练的 CNN 受益于高维隐空间表示,但数据集优化的 SSL 在高(512)和低(128)维隐空间表示中实现了相似的性能。对于高维和低维隐空间表示,位置正则化 SSL 分别使 CNN 性能比预训练模型提高了 和 。对于 ViT,高维度对预训练和数据集优化的 SSL 均有益。尽管与标准 SSL 方法相比,位置正则化提高了 SSL 性能,但预训练的 ViT 表现出很强的泛化能力,其 F1 分数分别为 和 ,与表现最佳的位置正则化 SSL 相当。研究结果突出了位置元数据对 SSL 正则化的价值,特别是在使用低维隐空间表示时,并证明了高维 ViT 在海底图像分析中的强泛化能力。
引用
@article{arxiv.2509.06660,
title = {Investigating Location-Regularised Self-Supervised Feature Learning for Seafloor Visual Imagery},
author = {Cailei Liang and Adrian Bodenmann and Emma J Curtis and Samuel Simmons and Kazunori Nagano and Stan Brown and Adam Riese and Blair Thornton},
journal= {arXiv preprint arXiv:2509.06660},
year = {2025}
}