中文

PixDLM:一种用于无人机推理分割的双路径多模态语言模型

计算机视觉与模式识别 2026-04-20 v1

摘要

推理分割最近已从地面场景扩展到遥感影像,然而无人机数据带来了独特的挑战,包括倾斜视角、超高分辨率和极端的尺度变化。为解决这些问题,我们正式定义了无人机推理分割任务,并将其语义需求组织为三个维度:空间推理、属性推理和场景级推理。基于此表述,我们构建了 DRSeg,一个用于无人机推理分割的大规模基准,包含 1 万张高分辨率航拍图像,并配有覆盖所有三种推理类型的思维链问答监督。作为基准的配套,我们引入了 PixDLM,一个简单而有效的像素级多模态语言模型,作为该任务的统一基线。在 DRSeg 上的实验建立了强大的基线结果,并突显了无人机推理分割的独特挑战,为未来研究提供了坚实基础。

关键词

引用

@article{arxiv.2604.15670,
  title  = {PixDLM: A Dual-Path Multimodal Language Model for UAV Reasoning Segmentation},
  author = {Shuyan Ke and Yifan Mei and Changli Wu and Yonghan Zheng and Jiayi Ji and Liujuan Cao and Rongrong Ji},
  journal= {arXiv preprint arXiv:2604.15670},
  year   = {2026}
}

备注

Accepted to CVPR 2026 (highlight)