中文

用于海上多场景识别的轻量级多模态人工智能框架

计算机视觉与模式识别 2025-03-11 v1 人工智能 机器学习 机器人学

摘要

海上多场景识别对于增强智能海洋机器人的能力至关重要,特别是在海洋保护、环境监测和灾害响应等应用中。然而,由于环境干扰导致海洋条件使图像质量下降,加上海上场景的复杂性需要更深层的推理才能准确识别,该任务面临重大挑战。仅靠纯视觉模型不足以解决这些问题。为克服这些局限性,我们提出了一种新颖的多模态人工智能(AI)框架,该框架整合了图像数据、文本描述以及由多模态大语言模型(MLLM)生成的分类向量,以提供更丰富的语义理解并提高识别准确率。我们的框架采用高效的多模态融合机制,进一步增强了模型在复杂海洋环境中的鲁棒性和适应性。实验结果表明,我们的模型达到了98%的准确率,比之前的SOTA模型高出3.5%。为了在资源受限的平台上优化部署,我们采用激活感知权重量化(AWQ)作为一种轻量级技术,将模型大小减小到68.75MB,准确率仅下降0.5%,同时显著降低了计算开销。这项工作为实时海上场景识别提供了高性能解决方案,使自主水面航行器(ASV)能够在资源受限的环境中支持环境监测和灾害响应。

关键词

引用

@article{arxiv.2503.06978,
  title  = {Lightweight Multimodal Artificial Intelligence Framework for Maritime Multi-Scene Recognition},
  author = {Xinyu Xi and Hua Yang and Shentai Zhang and Yijie Liu and Sijin Sun and Xiuju Fu},
  journal= {arXiv preprint arXiv:2503.06978},
  year   = {2025}
}

备注

19 pages, 4 figures, submitted to Engineering Applications of Artificial Intelligence