GLACIA:基于多模态大语言模型的分层湖泊分割与位置感知推理
计算机视觉与模式识别
2025-12-11 v1 人工智能
摘要
湖泊监测对于减轻预期的湖泊崩溃灾害风险具有着迫人的意义。然而,基于卷积神经网络 (CNN) 和视觉转换器 (ViT) 的现有分割方法局限于像素级预测,缺乏高层次的全局场景语义和人类可解释的推理。为此,我们引入GLACIA (\textbf{G}lacial \textbf{LA}ke segmentation with \textbf{C}ontextual \textbf{I}nstance \textbf{A}wareness),即首个将大型语言模型与分割能力集成,以产生准确的分割掩码和相应的空间推理输出的框架。我们构建了Glacial Lake Position Reasoning (GLake-Pos) 数据集管道,提供多样化的、以空间为导向的问答对,以弥补实例化位置推理数据在遥感领域的不足。定性评估表明,GLACIA (mIoU: 87.30) 超过了基于CNN的SOTA方法 (mIoU: 78.55 - 79.01)、ViT (mIoU: 69.27 - 81.75)、Geo-foundation models (mIoU: 76.37 - 87.10) 以及基于推理的分割方法 (mIoU: 60.12 - 75.66)。我们的方法通过自然语言交互,使其在快速变化的冰川环境中实现直观的灾害准备和知情决策,支持更有效和可解释的决策。代码已发布于 https://github.com/lalitmaurya47/GLACIA
引用
@article{arxiv.2512.09251,
title = {GLACIA: Instance-Aware Positional Reasoning for Glacial Lake Segmentation via Multimodal Large Language Model},
author = {Lalit Maurya and Saurabh Kaushik and Beth Tellman},
journal= {arXiv preprint arXiv:2512.09251},
year = {2025}
}