中文

RIS-LAD: 面向低空无人机图像分割的指代分割基准与模型

计算机视觉与模式识别 2025-09-26 v2

摘要

指代图像分割旨在基于自然语言描述分割特定对象,在视觉-语言理解中扮演着重要角色。尽管在遥感应用中取得了进展,但低空无人机场景下的指代图像分割仍未得到充分探索。现有的数据集和方法通常是为高空和静态视角图像设计的。它们难以处理低空无人机视角的独特特征,例如多样化的视角和高目标密度。为填补这一空白,我们提出了RIS-LAD,这是首个针对低空无人机场景的细粒度指代图像分割基准。该数据集包含从真实无人机镜头中收集的13,871个精心标注的图像-文本-掩码三元组,重点关注小目标、杂乱和多视角场景。它突出了先前基准中不存在的新挑战,例如由微小目标引起的类别漂移和拥挤同类目标下的目标漂移。为了解决这些问题,我们提出了语义感知自适应推理网络。SAARN并非统一注入所有语言特征,而是将语义信息分解并路由到网络的不同阶段。具体来说,类别主导的语言增强模块在早期编码阶段将视觉特征与目标类别对齐,而自适应推理融合模块则跨尺度动态选择语义线索,以改善复杂场景中的推理。实验评估表明,RIS-LAD对最先进的指代图像分割算法提出了重大挑战,同时也证明了我们提出的模型在应对这些挑战方面的有效性。数据集和代码将很快在 https://github.com/AHideoKuzeA/RIS-LAD/ 公开发布。

关键词

引用

@article{arxiv.2507.20920,
  title  = {RIS-LAD: A Benchmark and Model for Referring Low-Altitude Drone Image Segmentation},
  author = {Kai Ye and YingShi Luan and Zhudi Chen and Guangyue Meng and Pingyang Dai and Liujuan Cao},
  journal= {arXiv preprint arXiv:2507.20920},
  year   = {2025}
}