基于视觉基础模型与适配器学习的多时相、多空间珊瑚礁状况监测多标签分类
计算机视觉与模式识别
2025-12-18 v1
摘要
珊瑚礁生态系统提供着不可或缺的生态服务,但面临着来自气候变化和人类活动的严重威胁。尽管深度学习的进步使得珊瑚礁状况的自动分类成为可能,但传统的深度模型在处理复杂的水下生态图像时难以实现高性能。视觉基础模型以其高精度和跨域泛化能力而闻名,提供了有前景的解决方案。然而,微调这些模型需要大量的计算资源并导致高碳排放。为了应对这些挑战,诸如低秩适应之类的适配器学习方法应运而生。本研究引入了一种将 DINOv2 视觉基础模型与 LoRA 微调方法相集成的方案。该方法利用在泰国涛岛 15 个潜水点的水下调查中收集的多时相现场图像,所有图像均根据基于公民科学的保护计划所使用的通用标准进行标注。实验结果表明,DINOv2-LoRA 模型实现了卓越的准确率,匹配比为 64.77%,而最佳传统模型仅为 60.34%。此外,引入 LoRA 将可训练参数从 1,100M 减少至 5.91M。在不同时间和空间设置下进行的迁移学习实验突显了 DINOv2-LoRA 在不同季节和地点间出色的泛化能力。本研究首次探索了在多时相和多空间设置下,基础模型对珊瑚礁状况多标签分类的高效适应。所提出的方法推进了珊瑚礁状况分类,并为珊瑚礁生态系统的监测、保护和管理提供了一种工具。
引用
@article{arxiv.2503.23012,
title = {Multi-label classification for multi-temporal, multi-spatial coral reef condition monitoring using vision foundation model with adapter learning},
author = {Xinlei Shao and Hongruixuan Chen and Fan Zhao and Kirsty Magson and Jundong Chen and Peiran Li and Jiaqi Wang and Jun Sasaki},
journal= {arXiv preprint arXiv:2503.23012},
year = {2025}
}