DiffRIS:利用预训练文本到图像扩散模型增强指派遥感图像分割
计算机视觉与模式识别
2025-06-25 v1 人工智能
摘要
指派遥感图像分割 (RRSIS) 通过自然语言描述实现对遥感影像中区域的精确描绘,服务于灾后响应、城市发展和环境监测等关键应用。尽管近期进展取得显著成果,当前方法在处理航空图像时面临诸多挑战,包括尺度变化、多样化姿态和从 Overhead 视角中固有的语义模糊。为此,我们提出 DiffRIS,一种新型框架,利用预训练文本到图像扩散模型的语义理解能力,增强 RRSIS 任务中的跨模态对齐。我们的框架引入两个关键创新:上下文感知适配器 (CP-adapter),通过全局上下文建模和对象感知推理动态细化语言特征;渐进式跨模态推理解码器 (PCMRD),实现文本描述与视觉区域的迭代对齐,以实现精确分割。CP-adapter 弥合了通用视觉语言理解与遥感应用之间的领域差距,而 PCMRD 通过多尺度特征交互实现细粒度语义对齐。详尽实验表明,DiffRIS 在三个基准数据集 RRSIS-D、RefSegRS 和 RISBench 上均优于现有方法,建立了 RRSIS 任务的新型最佳性能。显著的性能提升验证了通过预训练扩散模型实现遥感应用适应性框架的有效性。
引用
@article{arxiv.2506.18946,
title = {DiffRIS: Enhancing Referring Remote Sensing Image Segmentation with Pre-trained Text-to-Image Diffusion Models},
author = {Zhe Dong and Yuzhe Sun and Tianzhu Liu and Yanfeng Gu},
journal= {arXiv preprint arXiv:2506.18946},
year = {2025}
}